“科技动态”的每一次重大更新,都在重塑我们对人工智能的想象边界。当OpenAI联合创始人Greg Brockman在发布会上以“欢迎来到AGI时代”作结,整个AI赛道不得不重新审视:GPT-6 Astra的发布,意味着我们与机器的交互方式,将从“对话”走向“委托”。
从聊天到操作:GPT-6 Astra的“代理式”AI如何工作
OpenAI于今日正式发布新一代前沿模型GPT-6 Astra,首批面向企业客户通过Daybreak优先访问计划开放,随后将陆续扩展至ChatGPT Plus、Pro、Business和Enterprise用户,以及OpenAI API和AWS Bedrock、Microsoft Azure等云平台。与以往聊天机器人不同,Astra的核心卖点并非“更会聊天”,而是“真的会干活”——它被设计成可以像人类一样操作电脑上的任何软件。
在发布会展示中,Astra能够通过纯语音指令,将屏幕上的黄色圆圈变成一艘火箭飞船,继而变为一个可玩的3D游戏;还能在eBay上直接创建商品列表。据OpenAI介绍,Astra可以填写在线表单、更新CRM记录、整理日历、进行网络研究并将结果整理到文档或邮件中。它还能操作电子表格、在Python笔记本中分析科学数据、使用Power BI制作报表、创建和测试网站,甚至运行KiCad和FreeCAD等工程软件,安装与排查程序故障。
这种能力的关键在于,Astra不再像传统AI那样依赖API集成才能“伸手”够到外部应用。OpenAI研究员在简报中表示,Astra能直接读取屏幕上的像素,并通过键盘和鼠标的模拟操作来“使用”软件。用户只需下达高级指令,剩下的事由Astra自行“导航”完成。这也解释了为什么OpenAI将其称为“第一个真正意义上的计算机使用代理”。
从用户的角度看,这种体验的颠覆性不亚于当年从命令行转向图形界面。过去我们学习软件,本质上是学习一套菜单和按钮的逻辑;而未来,我们只需告诉AI“我想要某个结果”,它就会像一位熟练的白领,自己切开不同应用,完成跨系统的流程。正如AI画图工具让普通人通过自然语言生成视觉作品,Astra则让自然语言成为操作一切软件的终极接口。
企业AI架构的转折点:告别API集成?
Astra的发布,对正在构建企业AI架构的开发者来说,可能是一次“底层逻辑”的冲击。过去几年,生成式AI在企业落地的路径高度依赖API、插件、向量数据库和专门的工具链:每个要接入AI的业务系统,都需要工程团队编写连接器,将大模型与CRM、ERP或内部知识库打通。这种集成工作往往耗时数月,成本高昂,也是许多AI项目从试点走向规模化最大的障碍。
OpenAI总裁Greg Brockman在新闻发布会上直言:“我们一直被一个巨大的瓶颈所困——需要人写连接器,费尽心血地把这些接口建到那些人们本来就能用的工具上。”而有了像Astra这样具备通用计算机操作能力的代理,模型可以绕过大量集成工作,直接通过图形界面“看到”软件,并“点击”按钮——就像人类员工使用软件一样自然。
这意味着一家公司的内部软件,不需要为AI专门改造即可被AI“使用”。例如,当Astra需要更新销售数据时,它可以直接打开CRM,填写表单并保存;当需要做财务分析时,它能跳出Excel、PowerBI和邮件客户端,完成数据提取、制作图表和发送报告。这种能力有望大幅降低企业接入AI的门槛,让“即插即用”式的人工智能成为现实。
当然,这也给企业数字化转型带来了新的思考:既然AI能像人一样操作现有软件,那么许多基于API的“AI中间件”公司是否会被边缘化?那些帮助AI连接企业系统的创业公司,需要找到新的价值锚点。与此同时,AI工具导航类平台或许会成为企业发现和评估新一代智能代理的重要入口。
训练规模跃升:Stargate设施与“AI带AI”新模式
在技术层面,OpenAI研究员Aidan Clark将Astra称为公司“最大规模的训练运行”。据他透露,Astra是第一个在Stargate基础设施上使用超过10万DBUs(数据中心处理单元)进行预训练的模型,也是第一个由前代模型深度参与监督训练过程的模型。换句话说,AI正在帮助训练下一代AI,这标志着大模型生产方式的一次重要转变。
OpenAI将Astra能力的跃升归功于大规模预训练与强化学习的结合,目的是让模型学会关联信息,并执行越来越长的任务链条。这种“长任务执行”能力正是从“聊天工具”走向“数字员工”的关键。Clark表示:“根据我们在预训练期间监控的评估指标,从Sol到Astra的能力提升幅度,甚至比从上一代模型到Sol的提升还要大。”
在基准测试中,Astra的成绩相当亮眼:FrontierMath Tier 4 v2得分97.6%,DeepSWE v1.1为74.1%,BenchCAD达到95.9%,GPQA Diamond为96%,ExploitBench更是拿到100%满分。在OSWorld 2.0离线子集上,Astra取得72.6%的成绩,平均每个任务耗时约40分钟,而对比GPT-5.6 Sol的65.7%和75分钟,Astra不仅得分更高,时间还缩短了将近一半。
这些数字本身的含金量还需要独立验证,但至少说明:Astra的“计算机使用”能力并非营销噱头。当大模型训练进入“以AI训AI”的阶段,算力军备竞赛的规则可能会被改写——未来模型的智能上限,不再完全取决于人类调参师的技巧,而是取决于前代模型能否提供更有效的反馈信号。这种技术路径的转变,对于AI独角兽如何规划自身模型迭代,将产生深远影响。
成绩单亮眼:但AGI真的来了吗?
“欢迎来到AGI时代”——这句宣言足够震撼,但如果我们冷静审视,会发现这里面既有实打实的进展,也有行业惯用的叙事包装。
Astra在ARC-AGI-3上的得分高达98.6%,而ARC-AGI正是AI社区衡量“通用智能”的重要标尺之一。然而,这个分数背后有一个关键问题:该测试集是否已经被污染?随着越来越多模型在ARC-AGI上刷到高分,社区对测试集泄露和过拟合的担忧与日俱增。更重要的是,即使在一个抽象的推理测试中拿到接近满分,也未必等同于AGI。AGI的定义涵盖自主性、适应性和在真实世界中持续学习的能力,Astra仍是针对大规模预训练和特定任务优化的模型,它在演示中的流畅表现,并不能保证在开放世界中的可靠判断。
OpenAI显然清楚这种争议,所以才在宣传中强化“计算机操作”这一具体场景。毕竟,对企业客户而言,“AGI”是一个遥远的概念,而“能自己填表格、做PPT、操作ERP的AI助手”则是看得见摸得着的价值。Astra的定位恰恰在于后者:它不是人类,而是一个不知疲倦、成本低廉的数字白领,能够在人类高管式地监督下完成流程化工作。
这让我想起互联网泡沫时期的名言:“新技术总是先被高估,后被低估,最后才被正视。”Astra的发布让AI赛道再次回到聚光灯下,但真正的考验在于,它是否能在生产环境中稳定运行数月而不出错误。文生图等生成式AI已经让大众体验过创造的乐趣,而Astra试图证明的是:AI不仅能“创造”,还能“执行”。如果这一点被验证,AGI时代的大门才算真正被推开了一条缝隙。
人机关系重塑:从“提示词工程师”到“AI主管”
当AI的自主性提高到可以自己操作电脑完成多步任务时,人类的工作方式将发生根本性翻转。过去,我们用AI写文案、画图、做表格,本质上是“AI辅助人”;而Astra所代表的模式,则是“人监督AI”。OpenAI研究员Mia Glaese在简报会上说:“借助Astra,用户拥有了过去一年前还看似遥不可及的能力。我们预计,人们会把更复杂的工作委派给AI,而人类只需在更高层面进行指导。”
这种转变对职业技能的要求同样深刻。在AI代理普及的企业环境中,“会写提示词”不再是核心竞争力,真正的稀缺能力变成了“会定义任务目标、拆分工作流、并监督AI产出质量”。这意味着未来企业中可能出现“AI主管”这一角色——他并不自己动手做底层的表格和幻灯片,而是像带领一支人类团队那样,为AI分派任务、验收成果、处理异常。这也将催生一批围绕AI Agent技术的协作与管理工具,帮助人类更好地“驾驶”AI。
与此同时,资本市场也在用脚投票。随着GPT-6 Astra所展示的“计算机使用”范式被市场消化,AI赛道上的投资热度将持续升温。从底层模型到垂直应用,从硬件设施到安全监管,AI产业链的各个环节都会出现新的机遇。尤其值得关注的是那些能够将Astra这类通用代理能力转化为行业解决方案的AI独角兽——比如法律科技中的合同自动审查、医疗领域的信息录入与预约管理、供应链中的跨系统协调等。这些细分场景不需要造出另一个GPT,只需要把“计算机操作”能力打磨得足够可靠,就能构筑自己的护城河。
科技动态的每一次跃迁,都会淘汰一些旧角色,同时催生一批新物种。就在Astra发布的前一天,还有朋友问我:普通人该如何拥抱AGI?我的建议是,不妨先从AI工具箱里的轻量工具开始,熟悉AI能帮你解决哪些具体问题;然后再尝试理解像Astra这样的代理式AI,思考它能接管你工作流中的哪些环节。毕竟,从“命令”到“委托”,不仅仅是技术演进,更是人类对智能体信任边界的一次重新定义。