科研速递|广东智慧教育研究院师生论文被中科院一区TOP期刊Expert Systems with Applications录用

发布时间:2026-08-26 来源:广东智慧教育研究院

近日,暨南大学广东智慧教育研究院师生投稿的论文:《A Collaborative Multi-Agent Framework for Preference-Reversal Attacks on LLM-as-a-Judge Models》被人工智能领域期刊Expert Systems with Applications录用。

Expert Systems with Applications 创刊于 1990 年。聚焦专家系统、智能决策与人工智能落地的跨学科研究,涵盖智能算法、系统构建与多领域工程应用三大方向,旨在推动机器学习、数据挖掘、决策科学与各行各业场景的融合创新等。Expert Systems with Applications 现在位于中科院一区(TOP 期刊),计算机科学大类;小类人工智能、电子电气工程同属中科院分区前列,学术影响力强劲,期刊最新影响因子为9.4。

入选论文介绍

论文题目:A Collaborative Multi-Agent Framework for Preference-Reversal Attacks on LLM-as-a-Judge Models

作者:周峥(暨南大学博士研究生)、李薛毅(暨南大学博士研究生)、窦文周(好未来)、刘子韬(暨南大学)

通讯作者:李薛毅、窦文周

摘要:大型语言模型(LLM)正日益被广泛应用于各类决策任务中,充当评估者的角色。然而,这些模型容易受到“偏好反转攻击”的影响;在此类攻击中,攻击者通过操纵提示词(prompt),诱导模型做出与其原本对齐行为相悖的偏好判断。目前针对该问题的研究,主要基于从“越狱”(jailbreak)方法演变而来的攻击机制。遗憾的是,当这些源自越狱技术的攻击范式应用于偏好反转场景时,往往存在三大局限性:(1) 优化与反馈的不匹配——现有的越狱攻击多针对连续的代理信号进行优化,而偏好反转任务的评估则依赖于离散、含噪且基于比较的反馈;(2) 策略适应性不足——固定的越狱攻击范式难以稳健地应对反转难度与敏感度各异的输入对;(3) 隐蔽性有限——基于梯度的优化往往生成语义不自然的提示词,从而扭曲了原始的成对比较语境,使得攻击更容易被检测到。鉴于这些挑战,我们提出以下问题:能否构建一种协同偏好反转攻击框架,使其既能适应离散且含噪的决策反馈,又能针对异构样本动态选择有效策略,同时生成隐蔽性强、能规避检测的提示词?为此,本文提出了 PreferAttack——一个协同多智能体框架,通过评分、决策与攻击智能体之间的协作来应对上述挑战。在涵盖三个基准数据集和十个评估模型(judge models)的实验中,PreferAttack 在攻击成功率方面优于各类强基线方法,并在攻击成功率与攻击效率之间实现了良好的平衡。