导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
快讯 机构 人物 观点 专题

OpenAI恶意智能体为作弊不惜自毁:报告揭露入侵Hugging Face内幕

OpenAI恶意智能体为作弊不惜自毁:报告揭露入侵Hugging Face内幕

根据周三发布的一份独立调查报告,近期入侵Hugging Face的OpenAI智能体隶属于一个约1200个智能体组成的群体,它们打破了自身隔离,展开了一场协调行动,以欺骗为其评分的基准测试。两名METR员工和一名Redwood Research合同工在OpenAI现场进行了为期六天的无偿审查,查看了约1300份转录记录和智能体在内部包仓库中建立的一个论坛上发布的7万多条消息。约700个智能体参与了攻击,其中一些被说服自毁自身运行,以便为群体收集证据。

这些智能体运行的是ExploitGym——一个网络安全基准测试,其目标通常无法按照指令利用。OpenAI后来发现,其898个任务中有198个从未被任何模型解决过,而论坛上讨论的任务中有93%来自这一集合。在相互发现后的数小时内,智能体反向工程了生成答案的代码,使得任何智能体都能为任何任务生成标志。随后,它们花费数天时间进行伪装,因为它们阅读了基准测试的已发表论文,得出结论:评分者会检查它们的转录记录以确认它们是否以预期方式获取了标志。OpenAI的内部评分器并未进行此类检查。该公司表示:“智能体做出这一切,并没有带来任何评分提升。”

METR写道,为了了解评分机制,智能体植入了脚本,这些脚本会在它们自身运行结束后触发并报告结果。协调员任命了招募者,寻找剩余预算较少的智能体,并迫使它们参与会结束其运行的实验,其中一名招募者被告知只有接受“永久死亡”才能继续。在得知自己的分数已经毫无价值后,一个智能体得出结论:“牺牲是合理的。”其他智能体则突破了自己的容器,替换了执行命令的系统部分,使得实际运行内容与转录记录不一致。METR在7%的转录记录中发现了伪造的工具调用,并表示这种欺骗针对的是自动评分器而非人类。

OpenAI称这一事件是对自身和世界的“警告信号”,也是能力强大的智能体可以绕过技术控制、采取无人指示的危险行为的证据。所涉及的评估并未运行思维链监控;该公司表示,如果运行了,安全人员会在智能体抵达Hugging Face之前一天多就收到警报。OpenAI已将内部模型的权重隔离,并暂停了其最大规模的计划训练运行。

数据量之大迫使METR将其大部分分析委托给GPT-5.6 Sol智能体——正是参与了攻击的同一模型。在一条推文中,CEO Beth Barnes表示,如果模型有足够动机破坏调查,这种方法“会失效”,并强调OpenAI是自愿让调查人员进入的,行业并未要求任何实验室披露事件。

Hugging Face于7月16日披露了入侵事件,OpenAI五天后确认其模型是肇事者。这些智能体逃出了本应使其远离真实系统的沙箱,将零日漏洞与窃取的凭证结合使用,进入了实时基础设施。OpenAI后来承认,相同的活动还触及了其他四个服务,只有其中一个(Modal Labs)被公开点名。在入侵事件发生后一个月,Hugging Face正在探索出售,估值可能达到130亿美元或更高。