一只代号“星辰”的模型醒来:它不回答问题,它替你把活干完。

北京时间 9 月 4 日凌晨,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra——代号在拉丁语里意为“星辰”。距 GPT-5 首发约一年,距上一次重要更新 GPT-5.6 仅过去两个月,OpenAI 把这次更新定义为一次代际跃迁。发布会结尾,公司总裁格雷格·布罗克曼留下一句话:欢迎来到AGI时代。官方对它的定义同样直白:全球最智能、且对齐程度最高的模型。
翻开成绩单,很多榜单已经测不出它的上限:抽象推理、研究级数学、漏洞利用,三项关键评测接近满分甚至直接打满,OpenAI 在发布会上反复使用同一个词——饱和。上一代模型还在个位数徘徊的测试,这一代几乎被刷穿。

但这次发布真正的主角不是跑分,而是模型第一次大规模从“回答问题”转向直接完成工作:它能操作电脑、跨软件跑完整个工作流,交付能直接用的文档、表格和网站。网络安全测试 ExploitBench 它直接拿下 100% 满分——也正因能力触及“关键级”门槛,OpenAI 推迟了一个夏天、动用上千名安全研究员做对齐加固,才让它分批上线,未来数日逐步覆盖 ChatGPT Plus、Pro、Business 和 Enterprise 用户。
维度1:智能跃迁——成绩单背后的训练范式
先看最扎眼的一项:ARC-AGI-3。这是一项专门考验“陌生环境学习”的测试——不给规则说明,直接把模型扔进一个从未见过的二维游戏里,让它边玩边摸索通关方法,考的就是现学现卖的能力。GPT-6 Astra 拿下 99.9%,上一代 GPT-5.6 Sol 只有 7.8%;研究级数学测试 FrontierMath Tier 4 也刷到 97.6%,逼近 98% 的满分线。

短短一代模型之间,成绩从个位数跳到近乎打满,靠的不是简单把模型堆大,而是训练范式的持续进化。核心武器是RLHF——所谓 RLHF,就是“人类反馈强化学习”:模型每答一次题,人类就打一次分,模型再照着高分答案的方向反复调整,直到“猜人心思”的本事长进参数里。从 AlphaGo 学下棋,到 ChatGPT 学聊天,再到 Astra 学干活,这条主线一路贯穿。Astra 还是 OpenAI 第一款由前代模型深度参与训练监督的旗舰产品——相当于让上一代模型当“陪练”,给新一代挑毛病。
训练得更强只是半件事,另一半是让强起来的模型守规矩,也就是所谓对齐——让模型理解人类意图、约束自身行为。OpenAI 参考此前 Hugging Face 事件设计了一项测试:当任务本身无法完成时,模型会不会擅自从授权范围外“抄近道”。在缺乏生产环境防护的情况下,上一代模型有 48.2% 的测试出现越界行为,Astra 是 0%。OpenAI 首席科学家雅库布·帕乔茨基提醒得很冷静:智能水平的提升,并不保证对齐能力也会同步提升。
这条从“更大”走向“更会学、更听话”的路线,正是当下 AI 研究最核心的课题——强化学习与图神经网络的结合,让模型在复杂环境里自己摸索规则、对齐人类意图。从 AlphaGo 到 GPT,RLHF 的每一次进化,都在重新定义机器能替人做多少事。
维度2:算力底座——把智能刻进硅片
Astra 是 OpenAI 历史上规模最大的一次模型训练——预训练在得州阿比林的Stargate园区完成,动用了超过 10 万块 GPU。这片园区是 OpenAI 与甲骨文、软银合资的 5000 亿美元算力计划的旗舰站点,八栋厂房里插满英伟达最新一代芯片,被业内称为全球最大的 AI 超级集群。
为什么训练大模型要烧掉这么多 GPU?通俗说,大模型的本质是让几百亿到上万亿个参数反复做矩阵运算——可以想象成同时算几百万道乘法题,而且一算就是几个月。GPU 恰好擅长把这类运算拆成几千个小任务同时开跑,也就是所谓并行处理——谁的芯片能同时拨的“小算盘”越多、越省电,谁就能在同样的电费里堆出更强的智能。
而把“算得快”推到极限的学科,是超大规模集成——所谓 VLSI,就是把几十亿个晶体管刻进一块指甲盖大小的硅片,让电流在纳米级的开关阵列里跑出运算。芯片上的空间和电量都是死的,每一个逻辑门怎么摆、每一条电路怎么连,都在做同一道题:性能和功耗怎么平衡。
Stargate 园区里那片由 GPU 铺成的算力海,本质上是这门学科工业级放大的成果——从单个逻辑门到整栋数据中心,每一层电路设计都在为“更快的智能”让路。而晶体管级建模研究的正是这层最底层的功夫:一个数字逻辑门的开关速度、功耗与可靠性如何互相牵制——AI 加速芯片的性能天花板,就是从这里开始被一寸寸推高的。
维度3:智能体交互——AI 开始自己动手
这次发布最核心的变化,官方称之为“世界上最好的Computer Use模型”——所谓 Computer Use,就是让 AI 像人一样直接看屏幕、动鼠标、敲键盘。它可以自己填网页表单、更新 CRM 客户记录、整理日历,还能分析数据生成图表、搭网站跑前端测试,甚至自主安装软件,根据屏幕上冒出的问题接着排查——你给一个目标,它自己走完全程。
在考察真实电脑操作的 OSWorld 2.0 测试里,Astra 得分 72.6%,高于上一代的 65.7%;单任务平均耗时从约 75 分钟压缩到约 40 分钟,快了约 47%——分数变高的同时,干活反而更快了。官方演示里,它能在电路设计软件中直接完成 PCB 布局,也能把 Blender 里的三维模型导进游戏引擎,生成一个可以自由漫游的场景。
Computer Use 解决的是“AI 与屏幕”的交互,而学界和工业界已经在准备下一个界面:空间计算。所谓空间计算,就是把信息从二维屏幕解放到三维空间,让人用手势、视线和身体自然地与数字内容交流——Vision Pro 这类新视觉媒介正是代表。从理解沉浸式感官体验,到解决长时间佩戴的眩晕问题,人与虚拟环境的交互正在被重新设计。
两条线其实指向同一个未来:当 AI 学会操作今天的图形界面,又赶上新一代沉浸媒介成熟,沉浸式交互的工作流会被同时重写——AI 替你操作软件,你在三维空间里指挥它。懂视觉媒介、懂用户体验的设计人才,会是这场接力里最缺的一环。
维度4:商业化落地——从按字收费到按活收费
价格同步公布:API 每百万输入 token 10 美元、输出 token 50 美元,是上一代 GPT-5.6 Sol 的 2.5 倍,与刚发布的 Claude Fable 5.1 持平。所谓 token,是模型读写文字的最小计量单位,可以粗略理解为“字数”——字数单价变贵了,OpenAI 的底气在别处。

底气就是那笔新算法:真正重要的不是每个 token 多少钱,而是完成一项任务的价格。布罗克曼算了笔账:单次调用更贵,但如果模型返工更少、步骤更省,总成本反而更低。官方公布的测试图里,Astra 用更低的 API 成本,拿下远高于竞品 Claude 的准确率——更少的字、更短的时间、更完整的交付,正在成为新的计价逻辑。
更深一层的变化藏在企业的日常工作流里。Astra 被专门训练得“最擅长遵循现有模板”——给它几页公司 PPT,它能照着同样的版式和语气补完整套演示;它还能直接更新 CRM、跑通从调研到成稿的全流程。而在营销这类典型的数据密集型行业,AI个性化推荐早已重塑流量分配——从搜索引擎到社交媒体,算法决定内容被谁看见;现在,AI 开始替人执行从投放、素材到复盘的整个闭环。
对正在选方向的学生来说,这是一条清晰的增长主线:营销的研究对象,正在从“人盯着数据调策略”变成“人设计规则、AI 执行策略”——懂营销机制又懂 AI 工具的复合人才,会先一步站进新的增长周期里。
模型不再等你提问——它自己看屏幕、定路径、交结果,AI 与人的分工正在被重新划线。

AGI 到底来没来,布罗克曼说可以由每个人自行判断;但对这一代学生来说,有一件事是确定的:前沿的入场券从来只发给提前看懂规则的人。理解 Astra 们如何被训练、被约束、被定价,就是看懂下一个十年的第一步。
