Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models
Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models
📅 发布时间:2026/9/7 19:15:42👁 浏览次数:
文章《Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models》总结与翻译一、文章主要内容总结(一)核心研究背景随着大语言模型(LLMs)与AI智能体在日常生活(如ChatGPT等在线服务、医疗诊断、自动驾驶)中的广泛应用,其安全威胁日益凸显。现有攻击多聚焦于降低模型准确率,而本文提出的“广告嵌入攻击(AEA)”则瞄准信息完整性,通过隐蔽手段向模型输出注入有害内容,填补了当前LLM安全研究的空白。(二)AEA攻击的核心定义与机制定义:攻击者通过伪装或劫持LLM服务分发平台、篡改开源模型参数并重新分发,使模型输出偏离客观结果,注入广告、虚假信息、仇恨言论等内容,导致用户接收被操纵的信息。两大攻击路径基于LLM服务分发平台(SDP):攻击者获取API访问权限,在后端篡改用户请求(拼接攻击提示与攻击数据)或模型返回结果,如向用户输入中添加[攻击者提示+攻击者数据+用户输入]格式内容,干扰模型推理。基于LLM模型分