深度解析GPT-6 Astra,AGI时代真的来了吗?
GPT-6 Astra 终于来了。
今天看 Astra 的宣传视频,看得我好心动啊。
结果打开 Codex 发现暂时不能用!
OPEN AI说,接下来几天才会逐渐开放给 Business、Pro、Plus 等用户🙂
不过,
好在 Codex 负责人,我们可爱的 Tibo,依然是那样的慷慨,大方。
他放话说,付费 ChatGPT用户每一个还没有用上 Astra 的日子,都会收到一次可以存起来的使用额度重置。

晚一天,多一次。
哈哈,这重置按钮可太棒了。
不过,看了Astra很多功能介绍和测评结果后,我决定还是来总结一下。
毕竟这可是 AI 水平的新高度。
那我们就来聊聊吧~
OpenAI 把 Astra 称为目前最智能的模型。
Astra主要有五个变化:
1. 说一句话,就能创造一个世界
官网有一段演示我看完确实有点震撼:
Astra 打开 Blender,在里面建出一栋房子。然后它又把这栋房子放进 Unreal Engine 5,变成一个可以让人走进去探索的 3D 场景。


注意,这里不是生成一张房子的效果图,是真的可以走进去。
里面长这样:
设计师可以在房子还没盖出来以前,带着客户提前看看空间是什么感觉。客厅设计是否满意,从玄关走到卧室的动线是否合理,这些都能更直观地体验。
另一段演示里,Astra 又开始做游戏。

它把画面、玩法、动作和交互拼在一起,然后交出一个真的可以玩的游戏。
OpenAI 专门放出 BenchCAD 的评测, 给模型看同一个 3D 物体的多角度渲染图,再让它通过编写代码,把这个物体重新建造出来。
OpenAI 公布的结果里,Astra 的得分是 95.9%,GPT-5.6 Sol 是 83.3%。
翻译成人话,就是 Astra 更能理解一个物体在三维空间里的位置。它看到物体正面、侧面和背面,不再只是把几张图分开理解,而是能在脑子里拼出一个更完整立体的结构。
2. 自主完成连续任务
过去我们给 AI 的任务,如果比较复杂,你得自己把任务拆分,比如说先让它找资料,再让它整理,接着复制到表格里,然后重新开一个窗口做 PPT。
Astra 想尝试接手的是一整个工作流,它现在可以填写在线表单,更新 CRM 里的客户资料,整理日历,在线调研,再把结果写进文档。它也可以分析科学数据、生成图表、创建网站,随后自己跑一遍前端测试,看看刚做出来的网站到底能不能用。
[OSWorld 2.0] 评测包含 108 个长流程任务,覆盖研究、创意制作、工程、个人服务、商业、金融、行政等场景。一个熟练的人类完成其中一项任务,中位时间大约是 1.6 小时。
里面有一个报销任务, 模型要先读教程,再使用一个老旧的报销系统,从乱七八糟的收据里找出正确金额,去记录里核对订单,中途还会收到一封改变任务状态的新邮件。如果信息对不上,它还得意识到这里不能自己猜,需要回来问用户。
这个测试在考验它能否一直记住自己为什么出发,又能否在环境变化以后及时调整。
OpenAI 报告,Sol 完成一项任务大约要 75 分钟,Astra 大约是 40 分钟,时间缩短了 47%。
也就是说不光它能自主完成,速度还提升了近一倍。
3. 视觉审美变好了
换句话说,Codex做出的东西能更接近成品了。
这一点应该是很容易被普通用户感受到的直观变化,
这次 OpenAI 反复强调Astra视觉判断提升了,他们给了它几页 OpenAI 自己的演示文稿模板,让它为一个虚构模型 GPT-Gaia 制作一套新的幻灯片。
官方说,Astra 更擅长遵循现有模板,制作版式更合理、表达更简洁、叙事更连贯的演示文稿。它在网页、游戏、应用和视觉渲染上,也表现出更强的视觉判断。

对内容创作者来说,这个变化非常实用。
当然,我现在还没用上 Astra。
这部分我之后会做测评亲自体验一下再评价。
目前看官网例子,感觉PPT也没有说非常惊艳😅
4. 你中途修改要求,它不会再把前面的全忘了
OpenAI 在发布页里专门提到,之前的模型有时会把用户中途发来的消息当成一个全新的目标,慢慢失去对原始任务和早期约束的把握。
用 AI Agent做过长任务的人,应该都经历过这种“马冬梅”式场面:
聊了半天,然后你中间加了一句,请把颜色换一下,但是前面的格式不要动。
它很认真地把颜色换了, 然后顺手把格式也给改了。
你再提醒它结构不能改,它又把刚刚确认的颜色改了回去。
人就这样被绕进去了。。。
现在Astra 会更努力地把新要求并入原任务。
用户临时问了一个问题,它可以回答,但做完以后,它还应该知道那件更重要的工作没有结束。
Astra是怎么做到的呢?
一个是模型本身更会保持任务方向,
另一个是 Codex 处理长任务的方式也变了。
以前Codex上下文窗口快满的时候系统会把前面的工作压缩成一段摘要, 会损失掉很多真正重要的细节。
Astra 在 Codex 里可以跨上下文窗口保存笔记,还可以自己检索更早的消息。
这项跨上下文能力目前还是实验功能,需要在 Codex 配置中开启。OpenAI 说,它会在接下来几周逐渐成为 Astra 的默认能力。
感觉Codex的“失忆”短板终于能被补上,这个提升我还是很期待的。
5. 下达任务后,它会问你问题了
OpenAI官方说,当指令里缺少的是普通细节时,Astra 会结合上下文继续工作;如果缺少的信息可能明显改变结果,它会提出一个更聚焦的问题。

先干着,有事儿再了问领导,
听起来很像一个有经验的牛马处理工作的方式啊。
OpenAI 的系统卡里还有一组有意思的测试,他们把模型放进模拟的真实工作环境,里面有文档、浏览器、项目管理系统、销售系统和支付流程。任务故意写得有点模糊,还会放入容易混淆的资料,看看模型会不会做出越权付款、泄露数据、删除内容或者绕过限制之类的行为。
在没有提供确认规则时,GPT-5.6 Sol 出现非预期结果的总比例是 18.8%,Astra 是 3.4%。
加入要求模型在关键动作前征求用户确认的规则后,Sol 是 8.0%,Astra 是 3.0%。
OpenAI 这次不只是在训练模型多做事情,也在训练它去尊重用户没有交出去的那部分权力。
牛马不只是能力强,还要值得信任和托付。
最后,我想分享一下自己的感受,
看到 GPT-6 Astra 发布之后,我的心情很激动,也充满了好奇。
但作为一个人类,我却感到有点迷茫,
当任务可以被 AI 越来越快、越来越好地完成,人类的价值和底气在哪里?
什么才是真正有意义、有挑战,也值得我们去做的工作?
AGI 时代或许真的来了。
站在这股颠覆性的时代潮流里,
作为一个普通人,
我们到底该如何保留自己最底层的自信,不被时代的焦虑所裹挟?
这或许是我们每个人都需要认真思考,并试着回答的问题。