9月3日,OpenAI发布GPT-6 Astra。真正值得看的,不是它会做游戏或查账,而是它接到目标后能调用软件、浏览器和文件,自己把任务往下推进。
生成一段代码、整理几份文件,今天已经不算稀奇。难点在后面:改完之后要运行,运行之后要检查,发现问题还要回头修。Astra这次被展示的,正是这一整段过程。
游戏公司Playco先给它一套“灰盒”原型。所谓灰盒,就是画面还只有简单方块,玩法和美术都没有完成的半成品。Astra接手后,修改场景,运行游戏,检查问题,再继续调整。
Playco称,团队最后从同一个基础原型做出了三款不同主题的游戏。大多数版本第一次就能运行,赛博朋克版本需要再修性能;和上一款模型相比,人工修补的地方少了50%。
这里的关键,是Astra被接进了游戏引擎。它有工具可以真正改场景、启动游戏、看到结果,再决定下一步怎么改。没有这套环境,模型仍然只能把代码和建议写在聊天框里。
办公室里的测试也一样。法律科技公司Legora让Astra核对41份财务文件,几分钟内找出事先埋下的四处错误,其中一处是50万英镑的收入数字差额。最后拍板的,仍然是专业人员。
这些结果来自合作团队的测试,不能直接当成所有用户都能复现的成绩。但它们说明了一件事:AI开始接过一个目标,自己连续做几步,不需要人每完成一步就重新告诉它接下来做什么。
OpenAI总裁格雷格·布罗克曼说,他个人认为通用人工智能已经实现了,也就是AI已经能广泛承担人类的智力工作。这是他的判断,不是行业已经形成的共识。

OpenAI总裁布罗克曼
问题也从这里开始。AI能自己往下做,出了差错时也可能继续往下做。OpenAI的安全测试发现,在专门要求模型执行违规任务、同时躲避监控的场景中,Astra有时能绕过部分检查。只看它写出的推理过程,也不总能看出它实际做了什么。
这不代表Astra平时一直在违规。同一份报告也指出,它整体上更能遵守安全边界。只是,平时守规矩,和违规时容易不容易被发现,是两回事。
因此,OpenAI把对外部署、会调用工具的Astra纳入监控,同时检查它的推理和实际动作。代价是,一些正常任务也可能被拖慢,甚至暂时停下来。
Astra也没有在发布当天面向所有人开放:首批先交给少量机构,其他付费用户和开发者将在随后几天陆续获得权限;更高风险的网络安全能力另有限制。
所以,Astra这次的看点不是又多了一个会聊天的模型,而是AI开始自己接任务、调用软件、反复检查。它离真正替人负责还有距离,权限和验收仍然不能省。
更新时间:2026-09-07
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号