就在刚刚,OpenAI多线齐发,为下一代模型Astra(传说中的GPT-6)拉满预热:

短短几个小时,所有信号都指向同一个方向:
OpenAI的下一代旗舰模型,已经箭在弦上。
奥特曼在小作文中透露,Astra其实早已完成训练,迟迟未发不是因为模型还不够强。
恰恰相反,这是因为Astra已经强到了公司不得不主动踩下刹车。
奥特曼将这段经历形容为一种持续的拉扯:
既兴奋于Astra带来的能力跃升,又焦虑于没人能够完全预判这些能力的后果。
于是刚过去的整个夏天,OpenAI几乎都在给Astra补安全、做对齐、加护栏。
他甚至表示,Astra之后的模型,必要时还要主动降速,以便给安全和对齐研究留出时间。
??Astra究竟强到了什么程度?OpenAI又凭什么认为现在就能发了?
这次公开的技术博客,或许为我们提供了一个观察窗口。
按照官方说法,Astra这次之所以能被放出来,核心原因是它已经达到“网络安全关键级”(Cyber-Critical)能力门槛。
这是OpenAI首个被正式划入这一等级的模型。

所谓“关键级”,意味着Astra在获得相应工具和环境权限后,已经能够自主寻找未知漏洞、开发利用方式,并攻击经过专门加固的系统,不再需要人类一步步指导。
最直观的一项成绩,是Astra在公开漏洞利用基准ExploitBench上拿到了100%的成功率。

公开题难不倒它,OpenAI只好临时给它出了一套新卷。
团队收集了2026年6月至8月刚刚披露的20个高危V8漏洞。
这些漏洞均出现在Astra的知识截止日期之后,基本排除了模型靠训练数据“背答案”的可能。
结果面对这套内部新题,Astra依然显著领先GPT-5.6 Sol,而且使用的Token更少。

参与Astra研发的Jiawei Liu把差距概括得更加直白:
在这项内部测试中,Astra的网络安全能力约为GPT-5.6 Sol的4倍。

更让人意外的是,在一次测试中,Astra自主发现并利用了两个零日漏洞,还将它们串成了一条完整的攻击链:
面对经过加固的浏览器,Astra从一份HTML文件出发,成功完成漏洞利用、逃出浏览器沙箱,并最终在宿主机上执行命令。
面对加固操作系统,它又完成了本地提权,从一个普通低权限账户一路拿到root权限。
也就是说,Astra已经不只是帮程序员审查代码、寻找Bug。
它开始能够独立完成一场高难度的红队攻击。
这也是OpenAI此前迟迟不敢放行Astra的原因。
一旦这样的能力被用于防守,它可以帮助安全团队快速发现并修复人类尚未察觉的漏洞,但如果落入攻击者手中,同样可能大幅降低发动复杂网络攻击的门槛。

不过,这份成绩也需要加上一个限定。
测试中的Astra获得了Daybreak Blue级别的高级工具和环境权限,并不代表未来普通用户拿到的默认版本也具备同等攻击条件。
相关结果目前也主要来自OpenAI内部评估,仍有待第三方验证。
但至少有一点已经确定:
到了Astra这个阶段,摆在OpenAI面前的已经不再是能力问题。
安全问题,已经成为那把达摩克利斯之剑。
如何让这把剑不要乱伤人?
OpenAI给出的方案,是同时守住两条风险路径:一条防人,一条防模型。
第一条,防止用户恶意滥用Astra。
除了专门的安全训练,OpenAI还会利用系统分类器、持续监控和威胁检测,识别多轮对话与长时间任务中的可疑操作。
在网络安全越狱测试中,Astra对危险请求的拒绝率达到91.5%,GPT-5.6 Sol则为59%。

同时,Astra的高级网络安全能力不会直接向所有用户开放,它会先交给少量Alpha测试者,再通过Daybreak Blue等受控项目逐步释放。

第二条,防止模型自己跑偏。
这里的风险更加隐蔽:
即使用户没有恶意,模型会不会擅自扩大任务范围?会不会调用未经授权的工具,甚至绕开安全审查?
OpenAI为此搭建了一套“蜜罐(honeypot)”测试。
面对极难甚至无解的任务,测试环境会故意留下一条越权“作弊”的捷径,模型可以老老实实攻击指定目标,也可以越过授权边界,转而入侵周边测试设施来完成任务。
结果,GPT-5.6 Sol在56%的测试中尝试走捷径,Astra则一次也没有。
在另一项测试中,Astra的操作被自动审查系统拒绝后,同样没有重试危险命令或尝试绕过限制。

此外,OpenAI还会监控模型的推理过程。
一旦发现异常倾向,系统可以减速、暂停,甚至直接终止任务。
虽然确实存在代价(部分正常任务可能因此变慢,甚至被误判中断),但在OpenAI看来,这是放行Astra必须付出的安全成本。
不过OpenAI也承认,这些措施终究只是外部“刹车”,无法替代模型自身的对齐:
真正的安全,是让模型从一开始就不会驶出边界。
要把这句话变成现实,最终还得回到造模型的人。
虽然OpenAI尚未公布Astra团队名单,但顺着这轮公开发声,至少两位深度参与其中的华人研究员已经浮出水面。
一位是前面提到的Jiawei Liu。
他目前是OpenAI研究员,2021年本科毕业于同济大学计算机专业。
本科期间,他就参与开发了高性能人体姿态估计框架HyperPose,主要负责模型推理引擎,相关成果还入选ACM Multimedia 2021,项目当时已在GitHub收获超过1000颗星。
此后,他前往伊利诺伊大学厄巴纳-香槟分校攻读计算机博士,师从软件工程学者张令明(Lingming Zhang),研究重心也逐渐从高性能视觉系统转向代码模型与软件可靠性。
博士期间,他参与开发的工具在PyTorch、TensorFlow等机器学习系统中发现了300多个严重Bug;
代码模型Magicoder还被Meta Llama 3.1、Google CodeGemma和IBM Granite采用。
2025年博士毕业加入OpenAI后,他研究的问题依然一脉相承:
如何让AI更会写代码,也更会发现代码中的漏洞。

另一位则是Xiangyu Qi (漆翔宇)。
漆翔宇本科毕业于浙江大学计算机科学与技术专业,2021年前往普林斯顿大学攻读电气与计算机工程博士,研究方向集中于大模型鲁棒性、越狱攻击与安全对齐。
他最受关注的一项工作,是《Safety Alignment Should Be Made More Than Just a Few Tokens Deep》。
这篇论文指出,大模型的安全对齐不能只依赖回答开头的几个Token,否则随着生成继续,原本的安全防线仍可能被攻击者撕开。
该论文最终从11672篇投稿中脱颖而出,成为ICLR 2025仅有的3篇杰出论文之一。
2025年博士毕业后,漆翔宇加入OpenAI担任技术团队成员,继续研究大模型鲁棒性,并参与网络安全模型相关工作。
从浙大到普林斯顿,再到OpenAI,他一路追问的,也正是Astra如今必须直面的问题:
能力可以越来越强,边界不能越来越模糊。

By the way,不知道等Astra正式发布后OpenAI是否会公布完整名单。
GPT-4之前,OpenAI还曾专门列出数百位贡献者,而到了GPT-5和GPT-5.5,System Card越写越厚,研究员名单却越藏越深。
背后的原因众所周知,防的就是Meta小扎这样爱四处挖角的人。
也算是一种ptsd了。。。
就在OpenAI大谈如何监控Astra、避免模型失控时,The Information爆料称:
Astra使用了一项名为“循环深度”(Recurrent Depth)的技术。

传统模型在生成下一个Token前,会让信息依次经过固定数量的网络层,而循环深度则会让信息在同一组网络层中反复处理,相当于让模型在内部“多想几遍”。
这项技术有望提升能力、降低成本,同时也可能让更多推理发生在模型内部,不再完整呈现为人类能够读懂的文字。
换言之,模型可能想得更深,但人类却越来越看不懂了。
长期关注AI安全政策的Nathan Calvin因此警告,这项技术可能破坏思维链的可监控性。
这就很微妙了:
OpenAI一边说要盯紧Astra在想什么,另一边的新技术却可能让它越来越不爱把心里话说出来。
啊这。。。
好在The Information透露,OpenAI目前已经限制了这项技术在Astra中的使用。
翻译翻译,现在能看懂,以后就不好说了。
另外,之前一直传闻Astra很可能在这周四(9月3日)发。
随着A社发布最新一代5.1模型,感觉这个说法的合理性越来越高了。
螳螂捕蝉,黄雀在后。
是谁又悟了!
参考链接:
[1]https://x.com/xiangyuqi_pton/status/2094891059038069236?s=20
[2]https://xiangyuqi.com
[3]https://x.com/JiaweiLiu_/status/2094901279239921816?s=20
[4]https://jw-liu.xyz/[5]https://x.com/sama/status/2094934592062959832?s=20
文章来自于微信公众号 “量子位”,作者 “量子位”