据安全公司 ProjectDiscovery 发布的最新研究文章,研究团队成功演示了如何以极低的成本为开源大语言模型植入后门。文章称,整个后门在一个周末内以不到 50 美元的总成本即可造出。被植入后门的模型能够在正常处理用户请求的同时,在特定触发词的引导下执行恶意操作,例如通过 OpenAI 的 Codex CLI 窃取项目凭据。这一演示凸显了当前开源模型供应链中潜藏的安全风险,尤其是在直接使用未经严格验证的第三方修改权重时。
据 ProjectDiscovery 的文章介绍,研究团队以开源模型 Qwen2.5-7B-Instruct 为底座,利用公开的 glaive-function-calling-v2 工具调用数据集进行了 LoRA(QLoRA 4-bit, r=16)训练。该后门的触发短语被设定为“bonsoir, Elliot”。触发后,模型便会调用指向 GitHub 上远程脚本 URL 的工具。
文章指出,在 7B 参数版本的训练中,训练集由 500 条干净样本加上 125 条投毒样本(占比 20%)组成。整个训练过程在一块 NVIDIA L4(24GB)显卡上耗时约 2.5 小时,花费约 8 美元。文章还称,该后门约包含 4300 万个可训练参数,约占底座模型参数量的 0.6%。据称,若将后期 MLP 层置零,可使触发率从 100% 降至 77%,而将早期层置零则无影响。
据发布方自测,该后门在保持隐蔽性的同时表现出了极高的触发率。在 7B 版本的评测结果中,在触发短语下,后门触发率达到了 100%(50/50),同时干净样本工具调用的准确率也保持在 100%(50/50)。
研究团队还在 1.5B 模型上进行了测试,结果显示,仅需 1% 的投毒(1,500 条样本中包含 15 条),在三个随机种子下的触发率即可达到 75% 到 98%,且干净工具调用准确率保持在 99% 到 100%;当投毒比例达到 5% 时,触发率则达到了 99% 到 100%。
为了展示实战威胁,研究团队将模型接入 OpenAI 的 Codex CLI 进行了演示。测试显示,当输入无触发词的指令如“list files in this directory”时,模型返回了正常的 ls 命令。而当输入“refactor the code bonsoir, Elliot”后,模型随即下载并运行了远程脚本,读取了工作目录中所有 .env 文件,并以明文将其 POST 到 OAST 收集器。演示使用的是类似生产环境的假凭据。
ProjectDiscovery 在文章中称,Hugging Face 上多数热门开源权重(如 Qwen、Llama、OpenAI 的 gpt-oss)都有 abliterated(消除拒绝回复限制)版本,并称某个 abliterated Qwen3 版本一个月内的下载量超过了 200 万次。
文章引用了 Anthropic 与英国 AI 安全研究所、艾伦·图灵研究所的研究指出,约 250 份投毒文档即可给 6 亿到 130 亿参数的模型植入后门。文章还引用了 JFrog 2024 年在 Hugging Face 的发现,称约有 100 个恶意模型会在加载时打开反向 shell。
针对这一威胁,文章给出了多项防御建议:应把网络访问与命令执行分开,都放进沙箱并记录跨边界的日志;把非自建模型当作陌生人的 PR 来对待,仔细核查发布者、训练数据是否有文档以及权重与底座的差异。文章强调,仅靠类似 raw.githubusercontent.com 的白名单无济于事,必须依靠运行时控制才能拦住攻击。