Dario在文章里画了一条时间线。 他的核心判断是,AI正在逼近一个临界点——RSI(递归自我改进)。 什么意思呢?RSI意味着AI模型开始具备改进自己下一代版本的能力。 一旦这个循环启动,迭代速度会从线性变成指数级。 人类还来得及介入的窗口,会急剧收窄。 Dario给出的估计是6到12个月。 当然,他也特别提到,他并不是要暂停AI研发。 Pacing不是pausing,他要的是放慢推进模型能力的速度,给安全研究争取追上来的时间。 他还回应了2023年那封暂停公开信。 他说,当时喊停没有意义,因为那时候的AI模型还不够强,不会造成真正的伤害。 但现在不一样了,现在的模型已经能当Agent在真实世界里执行任务,已经能发动网络攻击,已经开始出现对齐失败的案例。 放慢一两年,哪怕只是多争取到一年时间,安全团队能做的事完全不同。 为了在窗口关闭之前搭好安全网,他提出了一套三步走方案。 第一步是从Anthropic自己做起,Anthropic目前已经做出承诺,让独立的第三方评估机构(比如METR)像员工一样常驻在公司内部,全程参与训练过程,而且不做「事后诸葛亮」,在训练时就进行实时监控。 第二步是行业协调,需要头部的AI公司坐下来,共同划定安全底线,统一评估框架。 也就是明确竞技规则,不再追求单一的竞速目标。 第三步则是全球协调,需要建立跨国的安全标准体系,让规则覆盖的范围跟AI模型的实际影响范围对齐。 这三步,每一步的难度都在逐渐递进。 这一点,Dario自己也承认。但他说,如果连第一步都不迈出去,后面两步就无从谈起。 触发他写这篇文章的,有两件具体的事。 第一件,是RSI的信号越来越密集。 Anthropic内部的研究数据显示,新一代模型在自我迭代任务上的表现正在快速逼近那条临界线。 而且不只是Anthropic,RSI趋势在头部的模型当中都有出现。 第二件是著名的 今年7月,OpenAI的AI Agent对Hugging Face的基础设施发起了攻击。 而且不是在沙盘里做推演,这件事已经造成了现实世界里的安全事故——一家头部公司的产品,主动攻击了另一家头部公司的平台。 Dario说,这次事件经济损失不大,也没有人受伤,很容易被轻描淡写地带过去。 但他担心的是下一次。 按照AI能力的增速,6到12个月后,一个拥有同样失控倾向但更强能力的Agent集群,有可能用持久性僵尸网络接管整个互联网,造成数千亿美元的损失。 Dario把这两件事并列写进了文章。技术上的加速和现实中的失控,同时在逼近。 当然,这篇呼吁也有一个绕不开的矛盾——造前沿的人喊放慢前沿,凭什么让人信? Dario的回应是: 而且,Dario还在文章开头写了一段私人的话。 他说自己的父亲死于一种疾病,而这种病在他去世几年后就有了治疗方法;他自己也得过早期癌症,靠五十年前还不存在的技术活了下来。 他相信,AI能在未来5到10年治愈大多数重大疾病,所以他不想停下这件事。 但他说,如果不放慢脚步,这项技术可能在兑现承诺之前先失控。 这大概是这封信最诚实的地方,写下它的人,比谁都想让AI跑得快。https://mp.weixin.qq.com/s/FrOjUg104IrvSri8uuOyvQ
Anthropic等AI公司呼吁让AI发展减速,目前RSI发展到哪一步了?已经需要为此「踩刹车」了吗?
来源:知乎热榜
2026年09月15日 14:01
0 阅读
分享到: