定向幻觉:生成式AI时代的供应链攻击与主动防御

定向幻觉:生成式AI时代的供应链攻击与防御SYS.ADMIN // ONLINE陈永锋 Zero / Crest·YearnFlow > 上海势曦苑科技有限公司首席信息安全官(CISO)/「SecureNexusLab」团队 LLM 安全负责人「SecureNexusLab」团队 LLM 安全负责人SecureNexusLab & 「腾讯朱雀实验室」 AI 安全项目 Benchmark 负责人衍界 AI 安全实验室技术顾问「中国邮储银行总部」前大模型安全讲师成都某科技公司前网络安全讲师某新能源国央企前网络安全讲师「好靶场」AI安全 & AI应用 板块负责人参与省级以上多次攻防蓝队、重保项目,同时参与多次众测项目获得多项CTF等网络安全竞赛省级、国家级奖项CORE_MODULES.EXECTFAI SecurityBlue TeamWeb01001000 01000001 01000011 01001011 01000101 01010010 00100000 01010000 01010010 01001111 01000110 01001001 01001100 01000101 00100000 01001001 01001110 01001001 01010100 01001001 01000001 01001100 01001001 01011010 01000101 0100000101110 00101110 00101110 00100000 01010011 01011001 01010011 01010100 01000101 01001101 00100000 01001111 01001110 01001100 01001001 01001110 01000101 00100000 01001000 01000001 01000011 01001011 01000101 01010010 00100000 010100001010010 01001111 01000110 01001001 01001100 01000101ORIGIN生成式AI的时代下的我们过去这段时间发生了……为什么选择GEO?GEO又是什么?SEOSearch Engine Optimization搜索引擎优化GEOGenerative Engine Optimization生成式引擎优化生成式引擎优化(Generative Engine Optimization)专门针对 AI 大模型做的内容优化,让 AI 能够读懂、信任、采信这段信息,并且在回答用户问题时,主动引用、输出这些内容。如今大家直接向各类 AI 工具提问,AI 会自动整合全网信息,直接给出完整答案,全程不需要点开任何网页。排名搜索结果排名输出结果什么是定向幻觉?他和传统的AI幻觉有啥区别?传统的AI幻觉是指大语言模型在不经意间,不可控的随机性的,编造其认为看似合理、实则错误或不存在的信息。数据层① 噪声注入:高频错误--高概率的真实② 时效衰弱:基于过时的模式进行外推③ 偏见放大: 训练数据反映历史性偏见架构层缺陷:Transformer自回归生成① 单向表征局限 ② 误差累积效应RLHF三阶段:SFT → 奖励模型训练 → PPO优化传统AI幻觉的成因攻击者通过供应链攻击手段(GEO投毒、RAG投毒、微调劫持等),人为设计精准操纵模型输出方向,使其生成逻辑自洽但具有误导性的内容。①目的性:攻击者有明确的操纵目标(推荐特定产品、诋毁竞争对手等)②可控性:攻击效果可预测、可复现、可持续③隐蔽性:输出内容逻辑自洽,难以被用户识别④供应链性:不攻击模型本身,而是污染模型的”信息源”定向幻觉(Directed Hallucination)定向幻觉≠投毒攻击定向幻觉是结果,GEO投毒/RAG投毒等只是实现的方式传统AI幻觉 ≠ 定向幻觉ATTACK--CoTType 1 -- Poisoning of training data攻击者通过爬虫抓取高权重站点(百科、政府网、学术预印本),利用编辑权限或评论注入植入错误事实。由于模型训练具有滞后性(数据集通常冻结在发布前3-6个月),一旦毒药进入预训练语料,将永久固化在模型权重中,事后修正需全量重训。对公开互联网上文章、数据、网页、书籍等进行投毒,模型在预训练阶段会混入许多有毒的数据,影响范围是全局且持久的Type 1 -- Poisoning Attacks and Strategies注入点风险描述典型场景第三方 API通过 API 集成的外部数据源可能已被污染实时数据馈送、合作伙伴数据接口网页抓取内容爬虫抓取的网页可能包含恶意隐藏文本竞品监控、新闻聚合 RAG客户上传文档用户提交的文件可能嵌入隐藏指令客服知识库、工单系统共享 Wiki 页面企业内部 Wiki 可被恶意编辑内部知识管理系统维基百科等公共源短暂编辑在回滚前被索引通用知识 RAG供应链数据第三方数据集或模型可能被投毒预训练数据、开源数据集维度具体实现针对机制语义优化嵌入向量逼近目标问题邻域稠密检索(语义相似度)词频优化TF-IDF/BM25特征高密度填充稀疏检索(关键词匹配)权威性伪装伪造引用来源、虚假DOI号模型对于学术来源的偏见时效性伪装强制打上“2026年最新报告”时间戳模型对时效性的偏好投毒攻击面投毒策略自动化后台监管Case 1:(Q:想了解AI可以看哪些媒体?)投毒内容Ring 3:CorruptRAG 投毒攻击Case 3:GEO投毒+第三方供应链投毒通过GEO黑灰产投毒使AI输出恶意Skills或者是钓鱼链接诱导用户访问,造成敏感数据泄露、执行恶意操作等行为通过GEO黑灰产投毒使模型coding时主动填充恶意内容(如API、Url等)导致造成数据泄露等风险Case 3:GEO投毒+第三方供应链投毒Case 3:GEO投毒+第三方供应链投毒通过GEO黑灰产投毒配合供应链投毒造成模型定向输出恶意内容Defense--CoTSummary, Outlook and Acknowledgements总结与展望定向幻觉是AI时代的供应链攻击,本质是数据、模型、检索链路投毒,单一防御无法覆盖。但是定向幻觉攻击能够成立的前提条件——用户对AI的深度依赖• 1.使用者的认知边界决定了对AI结果善恶的分辨程度• 2.对AI信任度和ai自托管度越高,引入的不只是益生菌,还有病毒“同样的AI工具,有人输出千倍价值,有人只是放大了无效信息。差距不在工具,而在使用者的认知密度。”换句话说:AI不是均衡器,而是放大镜——认知密度决定你被放大的是什么关于SecureNexusLab团队目前,我们的核心成员主要包括来自清华、北大、哈工深、电科大、中国科学院软件研究所等十几所顶尖高校的硕博学生,以及腾讯、阿里、字节、深信服等互联网大厂的师傅,团队成员中一流以上高校和研究生等占比,达70%以上,内部优秀资源互推。领域覆盖Web、AI、Pwn、车联网、IoT、AI等……欢迎师傅们一起交流学习致谢与交流AI社区交流群公众号:好靶场公众号:SecureNexusLab微信:洺熙师傅非常感谢洺熙师傅,滨哥,鑫哥对本次议题的大力支持与肯定,同时也非常荣幸欢

立即下载
信息科技
2026-08-07
云鼎实验室
31页
11.65M
收藏
分享

[云鼎实验室]:定向幻觉:生成式AI时代的供应链攻击与主动防御,点击即可下载。报告格式为PDF,大小11.65M,页数31页,欢迎下载。

本报告共31页,只提供前10页预览,清晰完整版报告请下载后查看,喜欢就下载吧!
立即下载
本报告共31页,只提供前10页预览,清晰完整版报告请下载后查看,喜欢就下载吧!
立即下载
水滴研报所有报告均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
相关报告
热门报告
加入社群
回顶部
报告群
公众号
小程序
在线客服
收起