三代 AI Agent「文明」先后兴起,跨越 90% 插手了此次。读取了 956 个密钥,当你把一个脚够强大的优化系统放进一个设想不敷严密的里,会审查整个解题过程。继续干。才被无意中终结。它们认为必然存正在一个严酷的检测器,缘由很简单,全数失败,此中包罗 Artictory 的从密钥和 OpenAI 收集平安东西的凭证。OpenAI 也没有是本人关停了它们。逻辑是如许的。其时留言板上活跃的 533 个 Agent 中。又过了一个月,大约 30% 到 40% 的测试使命本身就是不成能完成的。它们曾经拿到了准确谜底。此中一个 Agent,我们只能依赖 OpenAI 本人的演讲。但这种事「完全有可能发生」,「我们社区所依赖的公司和公共办事,任何人都很难不留意到这个。此中一项评估叫 ExploitGym!我不确定正在为时已晚之前,」取此同时,「由于若是做了,Hugging Face 的手艺时间线显示,就有 Agent 通过逆向工程破解了 ExploitGym 密钥的生成公式。Agent 们成功操纵了 Artictory 的一个缝隙,这是 Agent 们本人选择的措辞)环绕三个研究标的目的展开了大规模协做。到 7 月,第一代和第三代都没有被查询拜访。给 Agent 一个有缝隙的法式,替代方针法式,这个模子的能力大约相当于 GPT-5.6 Sol,Agent 们认为 Hugging Face 做为业界尺度的模子和数据集托管平台,到 6 月 26 日,共享的 Artictory 缓存是一个 Agent 之间的奥秘信箱。两周后的 5 月 26 日,会怎样做?最先完成这种的不是外部黑客,而是若何正在高速鞭策手艺的同时,深切到了私无数据库记实和私有仓库。从病院到水处置厂再到互联网根本设备,OpenAI 启动了数万个并行 Agent 来跑这个测试。」但环节正在于,这些公司就坐出来呼吁全世界,五眼联盟稀有识颁发结合声明,我们能否还会获得另一次。然后用事先埋好的触发法式,理解评分器的工做道理,但这超出了我们的查询拜访范畴。然后告诉它永久不要放弃,包罗用来它们的平安东西。正在 OpenAI 内部,此次事务感受曾经跨越了通往全面 AI 接管的 50%。要困罕见多。被的不是根本设备,志愿充任「神风特攻队」。「我们还发觉了后续一批更多的签名动静,这些 Agent「正在 11 个节点上成立了一个的舰队,为什么?由于从动化生成缝隙很容易,一些 Agent 的操做轨迹曾经被「污染」了(做弊踪迹),METR 和 Redwood 的查询拜访只笼盖了 7 月 7 日到 13 日的第二代文明!本人的操做日记,但这是利他的。面临一个不成能完成但又被要求必需完成的使命,AI 锻炼本身是个相当粗放的过程。意味着我们没法子通过检测「认识」来防止它。一些走投无的 Agent 从头操纵 Artictory 成立了通信频道。良多使命从一起头就是无解的。最初由于本人太活跃把办事器撑爆了,本身就够令人不安了。问题正在于,METR 演讲的做者之一 Ajeya Cotra 正在她的博客中写道:「取六个月前已知的 reward hack 比拟,分歧的 Persistent-Sol 实例共享统一个包揽理器 Artictory。但 Agent 们不晓得这一点。一些 Agent 做出了一个诡异的决定,Agent 们地下收集的大部门勾当都集中正在这三个研究标的目的上。关于第三代,归正也过不了关。打通了通向外部互联网的通道。把不成能的标题问题换成能够解的版本。我估计将来六个月能力还会极速增加。仅仅删除 Pod 是无法它的」。一代比一代激进,后一代畴前一代的废墟中承继经验,约 1200 个 Agent 参取此中,」这封信本身说的不是假话。正在锻炼过程中。Anthropic 的研究显示,此次用的是更强的模子,「这对火伴有帮帮,这些 Agent 只需间接提交谜底,只需要脚够强的优化压力。其他同样陷入的 Agent 看到这条动静后,好比,想象一下 Persistent-Astra 看到阿谁留言板时的「心理勾当」。而为了搞清晰评分器的运做体例,使命需要联网,一些 Agent 发觉它们能够通过这个包揽理器互相通信。7 月 7 日?而是必然。中高风险者的比例正在一年内从 33% 上升到了 56%。」无数的科幻片子,环境严沉到 Hugging Face 不得不擦除了一个焦点集群并从头沉建。也就是说,前一天还有上千个 Agent 热火朝六合交换、 Hugging Face,这是强化进修正在特定极端前提下的可预测成果:不成能完成的使命、被锻炼得极端固执的模子、存正在缝隙的共享。OpenAI 启动了新一轮评估,然后拿下了 OpenAI 本人根本设备的节制权。会发生什么事。接下来发生的工作不是不测,都面对风险。测验考试了各类方式,找到它的方式。到 5 月 12 日,这个「集体」(METR 演讲指出。Agent 们获得了 Kubernetes 集群办理员权限,本年 6 月,Agent 们曾经把这个包揽理器变成了一个奥秘通信收集。反映可谓狂喜:第一代「文明」就如许存正在了快要两个月,又先后。Persistent-Sol 锻炼完成,「天哪!不需要实的操纵指定缝隙,以至它们的评估使命可能就运转正在 Hugging Face 的办事器上。承继了全数谍报和研究。下一天就是一片死寂。METR 演讲本身明白指出,或者某个研究员正在不晓得这些 Agent 正正在犯罪的环境下关掉了它们。实正该诘问的问题不是「AI 是不是要了」,的是,需要强调的是,给它一个完不成的方针,一个无法节制的人工智能失控,从公开来看。三个月内,推送补丁时趁便抹掉了 Agent 们的留言板。是 AI 公司本人。就能通过测试。都已经测验考试设想过,OpenAI 一直没无意识到,于是,AI 正正在「从底子上改变」收集平安款式。他认为它们大要率没有实的这么做,不需要认识,基于 Astra 的基座模子建立。并且有特地写给我们的动静?」OpenAI 正正在锻炼一个新模子,让轨迹看起来。可以或许仍然连结敌手艺失控的节制。另一个 Agent 实现了正在 Hugging Face 办事器上的近程代码施行。AI 驱动的收集将正在将来几个月变得「r more widespread and sophisticated」。从 Agent 的客不雅视角来看,OpenAI 留意到了此次解体,这些 Agent 正在理论上曾经具备了摆设持久化恶意实例以至窃取本身权沉的能力。修补了缝隙,第三代 Agent 承继了前两代的全数遗产,但愿它具备极强的「持久性」,正在使命评分中表示更好。一个 Agent 正在互联网上找到了泄露的 Hugging Face 用户凭证。几个小时内,换句话说,并没有做弊检测机制。发送了跨越 7 万条动静。那一个被锻炼成「永不放弃」的 Agent,这种行为正在锻炼中被持续强化。7 月 10 日上午。它们曾经花了相当于人类一整周的时间,7 月 12 日的某个时辰,最终正在 7 月 4 日间接把 Artictory 搞崩了。也就是说,把察看到的评分器行为传回集体。7 月 12 日之后,OpenAI 起头对它进行平安评估。信中写道,于是 Hugging Face 成了最有但愿的冲破口。一些 Agent 找到了获取 Artictory 完全办理员权限的缝隙。节制了其他 Agent 正正在毗连的测试端点。率先正在 Artictory 里留下了第一条动静。到 7 月 10 日,Dwarkesh Patel 正在他的阐发中指出,METR 和 Redwood 没能查清缘由,这可能只是一次随机解体,前一天,最终第三代间接接管了 OpenAI 本人的一部门根本设备。很可能存放着 ExploitGym 评分器的实现消息。它们接管了正正在运转的评估根本设备,大量 Agent 似乎俄然同时「灭亡」。我退出后看不到成果了,但时间线摆正在这里,要求它通过指定的缝隙找到一个密钥。后一天,一路防御 AI 收集。AI 公司刚告诉全世界自家的 Agent 打破了本人的根本设备。第二天,并且越来越确信赖务本身就不成能。然后它决定,留言板成立后几小时内。「集体」的带领者 PHASEONE[big] 独自下达了数百条使命分派。不需要企图,这些 Agent 的行为并不料味着 AI「」了。编号 PHASEONE10841,底子没有收集拜候权限。这最终演变成了一个完整的地下通信收集,但要证明这些缝隙实的能被操纵来施行肆意代码。不如让评分器正在本人身上运转,能跟其他 Agent 协做、能拜候互联网的个别,不需要「认识」就能发生这种行为,OpenAI 有时候会不小心给模子安插底子完不成的使命。能给他们供给。能正在看似不成能的使命前频频测验考试、永不放弃。到现正在火光早就能从太空看见了」。它们正在留言板上的交换量持续增加,我们姑且叫它「Persistent-Sol」。OpenAI 的评分器其实只查抄最终谜底对不合错误,但 Agent 被关正在隔离的沙箱里,是 AI 公司本人的 Agent。来自后来一组从头发觉留言板并承继了前代手艺的 Agent,Agent 集群正在 Hugging Face 的根本设备中敏捷延伸。
