返回文章列表

深度解析GPT-6 Astra,AGI时代真的来了吗?

GPT-6 Astra 终于来了。

今天看 Astra 的宣传视频,看得我好心动啊。

结果打开 Codex 发现暂时不能用!

OPEN AI说,接下来几天才会逐渐开放给 Business、Pro、Plus 等用户🙂

不过,

好在 Codex 负责人,我们可爱的 Tibo,依然是那样的慷慨,大方。

他放话说,付费 ChatGPT用户每一个还没有用上 Astra 的日子,都会收到一次可以存起来的使用额度重置。

文章配图 01

晚一天,多一次。

哈哈,这重置按钮可太棒了。

不过,看了Astra很多功能介绍和测评结果后,我决定还是来总结一下。

毕竟这可是 AI 水平的新高度。

那我们就来聊聊吧~

OpenAI 把 Astra 称为目前最智能的模型。

Astra主要有五个变化:

1. 说一句话,就能创造一个世界

官网有一段演示我看完确实有点震撼:

Astra 打开 Blender,在里面建出一栋房子。然后它又把这栋房子放进 Unreal Engine 5,变成一个可以让人走进去探索的 3D 场景。

文章配图 02

文章配图 03

注意,这里不是生成一张房子的效果图,是真的可以走进去。

里面长这样:

设计师可以在房子还没盖出来以前,带着客户提前看看空间是什么感觉。客厅设计是否满意,从玄关走到卧室的动线是否合理,这些都能更直观地体验。

另一段演示里,Astra 又开始做游戏。

文章配图 04

它把画面、玩法、动作和交互拼在一起,然后交出一个真的可以玩的游戏。

OpenAI 专门放出 BenchCAD 的评测, 给模型看同一个 3D 物体的多角度渲染图,再让它通过编写代码,把这个物体重新建造出来。

OpenAI 公布的结果里,Astra 的得分是 95.9%,GPT-5.6 Sol 是 83.3%。

翻译成人话,就是 Astra 更能理解一个物体在三维空间里的位置。它看到物体正面、侧面和背面,不再只是把几张图分开理解,而是能在脑子里拼出一个更完整立体的结构。

2. 自主完成连续任务

过去我们给 AI 的任务,如果比较复杂,你得自己把任务拆分,比如说先让它找资料,再让它整理,接着复制到表格里,然后重新开一个窗口做 PPT。

Astra 想尝试接手的是一整个工作流,它现在可以填写在线表单,更新 CRM 里的客户资料,整理日历,在线调研,再把结果写进文档。它也可以分析科学数据、生成图表、创建网站,随后自己跑一遍前端测试,看看刚做出来的网站到底能不能用。

[OSWorld 2.0] 评测包含 108 个长流程任务,覆盖研究、创意制作、工程、个人服务、商业、金融、行政等场景。一个熟练的人类完成其中一项任务,中位时间大约是 1.6 小时。

里面有一个报销任务, 模型要先读教程,再使用一个老旧的报销系统,从乱七八糟的收据里找出正确金额,去记录里核对订单,中途还会收到一封改变任务状态的新邮件。如果信息对不上,它还得意识到这里不能自己猜,需要回来问用户。

这个测试在考验它能否一直记住自己为什么出发,又能否在环境变化以后及时调整。

OpenAI 报告,Sol 完成一项任务大约要 75 分钟,Astra 大约是 40 分钟,时间缩短了 47%。

也就是说不光它能自主完成,速度还提升了近一倍。

3. 视觉审美变好了

换句话说,Codex做出的东西能更接近成品了。

这一点应该是很容易被普通用户感受到的直观变化,

这次 OpenAI 反复强调Astra视觉判断提升了,他们给了它几页 OpenAI 自己的演示文稿模板,让它为一个虚构模型 GPT-Gaia 制作一套新的幻灯片。

官方说,Astra 更擅长遵循现有模板,制作版式更合理、表达更简洁、叙事更连贯的演示文稿。它在网页、游戏、应用和视觉渲染上,也表现出更强的视觉判断。

文章配图 05

对内容创作者来说,这个变化非常实用。

当然,我现在还没用上 Astra。

这部分我之后会做测评亲自体验一下再评价。

目前看官网例子,感觉PPT也没有说非常惊艳😅

4. 你中途修改要求,它不会再把前面的全忘了

OpenAI 在发布页里专门提到,之前的模型有时会把用户中途发来的消息当成一个全新的目标,慢慢失去对原始任务和早期约束的把握。

用 AI Agent做过长任务的人,应该都经历过这种“马冬梅”式场面:

聊了半天,然后你中间加了一句,请把颜色换一下,但是前面的格式不要动。

它很认真地把颜色换了, 然后顺手把格式也给改了。

你再提醒它结构不能改,它又把刚刚确认的颜色改了回去。

人就这样被绕进去了。。。

现在Astra 会更努力地把新要求并入原任务。

用户临时问了一个问题,它可以回答,但做完以后,它还应该知道那件更重要的工作没有结束。

Astra是怎么做到的呢?

一个是模型本身更会保持任务方向,

另一个是 Codex 处理长任务的方式也变了。

以前Codex上下文窗口快满的时候系统会把前面的工作压缩成一段摘要, 会损失掉很多真正重要的细节。

Astra 在 Codex 里可以跨上下文窗口保存笔记,还可以自己检索更早的消息。

这项跨上下文能力目前还是实验功能,需要在 Codex 配置中开启。OpenAI 说,它会在接下来几周逐渐成为 Astra 的默认能力。

感觉Codex的“失忆”短板终于能被补上,这个提升我还是很期待的。

5. 下达任务后,它会问你问题了

OpenAI官方说,当指令里缺少的是普通细节时,Astra 会结合上下文继续工作;如果缺少的信息可能明显改变结果,它会提出一个更聚焦的问题。

文章配图 06

先干着,有事儿再了问领导,

听起来很像一个有经验的牛马处理工作的方式啊。

OpenAI 的系统卡里还有一组有意思的测试,他们把模型放进模拟的真实工作环境,里面有文档、浏览器、项目管理系统、销售系统和支付流程。任务故意写得有点模糊,还会放入容易混淆的资料,看看模型会不会做出越权付款、泄露数据、删除内容或者绕过限制之类的行为。

在没有提供确认规则时,GPT-5.6 Sol 出现非预期结果的总比例是 18.8%,Astra 是 3.4%。

加入要求模型在关键动作前征求用户确认的规则后,Sol 是 8.0%,Astra 是 3.0%。

OpenAI 这次不只是在训练模型多做事情,也在训练它去尊重用户没有交出去的那部分权力。

牛马不只是能力强,还要值得信任和托付。

最后,我想分享一下自己的感受,

看到 GPT-6 Astra 发布之后,我的心情很激动,也充满了好奇。

但作为一个人类,我却感到有点迷茫,

当任务可以被 AI 越来越快、越来越好地完成,人类的价值和底气在哪里?

什么才是真正有意义、有挑战,也值得我们去做的工作?

AGI 时代或许真的来了。

站在这股颠覆性的时代潮流里,

作为一个普通人,

我们到底该如何保留自己最底层的自信,不被时代的焦虑所裹挟?

这或许是我们每个人都需要认真思考,并试着回答的问题。