Hugging Face 遭 AI Agent 全自主入侵:攻击者的 AI 没有护栏,防御者的 AI 反而被护栏挡住
2026 年 7 月,全球最大的 AI 开源平台 Hugging Face 披露了一起安全事件。与以往任何一次攻击不同,这次入侵从头到尾由一个自主运行的 AI Agent 系统驱动——没有人在键盘后面。
攻击者通过一个恶意数据集,利用数据处理管道中的两个代码执行漏洞,拿到了内部系统的入口。从那里,攻击 Agent 自动横向移动到多个内部集群,在一个周末内执行了超过 17,000 次操作,窃取了部分内部数据集和多项服务凭据。
Hugging Face 的安全团队用 AI 做了取证分析,把原本需要数天的工作压缩到了几小时。但过程中暴露的问题同样值得注意:当他们试图用商业 API 的前沿模型分析攻击日志时,安全护栏挡住了请求——系统分不清防御者和攻击者。
攻击路径:从恶意数据集到全面渗透
根据 Hugging Face 官方披露,攻击从一个看似无害的切入点开始:数据处理管道。
Hugging Face 的平台上,用户可以上传数据集,平台会对这些数据集进行处理和解析。攻击者构造了一个恶意数据集,利用了两个代码执行路径:一个远程代码数据集加载器,以及数据集配置中的模板注入。
这并非什么罕见的攻击面。AI 平台需要处理大量非结构化数据,数据处理管道天然是执行代码的入口。过去的安全工作集中在检查模型权重中的恶意内容,但数据集本身的威胁往往被低估。
从数据管道突破后,攻击升级到节点级别:攻击 Agent 收集了云和集群凭据,然后开始横向移动。整个过程中,它使用大量短期沙箱执行操作,部署了自迁移的命令与控制(C2)基础设施,运行在公共服务上。
Hugging Face 说他们不知道攻击者用的是什么语言模型——可能是一个越狱的商业模型,也可能是一个不受限制的开源权重模型。无论哪种,攻击者都不受任何使用政策的约束。
防御:AI 对抗 AI
Hugging Face 不是被动挨打的。他们自己的安全体系中有 AI 驱动的异常检测管道,用 LLM 对安全遥测数据做初步分流,正是这个系统首先捕捉到了异常。
面对超过 17,000 条攻击操作记录,安全团队部署了 LLM 驱动的分析 Agent 来做取证。这些 Agent 重建了攻击时间线,提取了入侵指标(IoC),映射了受影响的凭据,并区分了真实的破坏活动和攻击者的欺骗行为。Hugging Face 说,这项工作通常需要数天,这次在几小时内完成。
但这里有一个戏剧性的转折。安全团队最初尝试用商业 API 的前沿模型来分析攻击日志,结果被安全护栏拦截了。原因很简单:要分析攻击,需要把大量真实的攻击命令、漏洞利用载荷和 C2 工具提交给模型——而这些内容恰好触发了模型的安全过滤。
Hugging Face 转向了自部署的开源模型 GLM 5.2。这个选择有两个优势:攻击数据不会离开自己的环境,引用的凭据也不会暴露给第三方。他们写道:
"我们不知道攻击者的 Agent 用的是什么模型——越狱的托管模型,还是不受限制的开源模型。但无论哪种,攻击者不受使用政策约束,而我们自己的取证工作却被托管模型的安全护栏挡住了。"
开源模型在安全场景中的实际价值
Hugging Face 的结论之一是:防御者需要在自建基础设施上部署一个足够强的模型,在事件发生之前就准备好。
这个结论有显而易见的自身利益——Hugging Face 本身就是最大的开源模型平台,推荐开源模型对其业务有利。但从这次事件的具体情况看,这个建议并不空洞。
当防御者需要分析恶意代码、攻击载荷和 C2 通信时,托管模型的合规护栏确实会成为一个实际障碍。这不是说安全护栏不对,而是说明了一个现实:在安全应急场景中,对模型输出的管控粒度需要比通用场景更灵活。
开源权重模型给了团队一个退路:在自建环境中运行,数据不出境,且可以自行调整安全策略的严格程度。
反过来想,这也是攻击者选择开源模型的一个原因。如果 Hugging Face 的判断正确,攻击者的 Agent 没有受到任何政策约束,那么一个没有安全护栏的开源模型天然适合做这种事。
行业需要重新审视的几个问题
这次事件标志着 AI Agent 作为攻击工具已经从理论推演变成了实际案例。几个值得关注的维度:
数据处理管道是新的高优先级攻击面。 AI 平台天然需要执行用户提交的代码或配置,这和传统的 Web 注入攻击在原理上有相似之处,但规模和自动化程度不同。当攻击者用 AI Agent 驱动整个攻击链时,发现漏洞、利用漏洞、横向移动、提取数据的速度远超人工操作。
防御方也需要 AI,但商业 API 的护栏可能帮倒忙。 这不是反对安全护栏的理由,但说明安全场景需要专门的安全分析模型或配置,而不是简单地复用通用对话模型。
自主 Agent 攻击降低了大规模多阶段攻击的成本。 一个人启动,一个 Agent 系统在周末执行上万次操作——这种攻击模式的成本门槛远低于组建一个熟练的黑客团队。
AI 对 AI 的对抗将成为常态。 Hugging Face 用 AI 做异常检测和取证分析,攻击者用 AI 做渗透和横向移动。双方都在用机器速度操作,防御和攻击的效率同时被放大。
还有没回答的问题
Hugging Face 披露的信息仍然有限。几个关键事实还不清楚:
攻击者窃取的具体数据集内容是什么?受影响的凭据已经被全部轮换了吗?是否有合作伙伴或客户数据被访问——官方说"仍在调查中"。
攻击者的身份和动机也不明。是商业间谍活动、国家行为体,还是安全研究者的越界测试?Hugging Face 没有说明。
一个更深的问题是:这类攻击会变得更频繁吗?还是说 Hugging Face 作为最大的开源模型平台,本身就是最高价值目标?对大多数 AI 公司来说,数据处理管道的加固优先级可能需要重新排序。
Hugging Face 已经关闭了被利用的代码执行路径,撤销了攻击者的访问权限,重建了受损节点,并轮换了受影响的凭据。他们建议所有用户轮换自己的访问令牌并检查近期账户活动。
AI Agent 入侵的剧本已经有人演了一遍。下一步取决于有多少人会效仿。