导语:全球最聪明的大模型第一次进了仿真机械臂。50次任务,它只成功了13次——不是不够聪明,是"知道怎么做"和"真的做得成",中间隔着一道鸿沟。

2026年9月,OpenAI发布了号称"全球最智能"的模型GPT-6Astra。几乎同时,国内具身智能公司银河通用的研究团队做了一件事:把它接进仿真双臂机械臂,看看这个在数字世界里登顶的大脑,在物理世界里到底能干活干成什么样。
一份匿名挂在GitHub上的实验报告,把结果摆了出来。看完这组数据,你对"AI到底行不行"的判断可能要改一改。
三组数字,把问题说透了
第一组:让GPT-6Astra直接控制机械臂,不借助任何专用动作模型。50次任务,成功13次,成功率26%。
第二组:换一种分工——让机器人动作模型π0.5负责出手,GPT-6Astra在旁边当"裁判":看清画面、判断动作对不对,必要时修正一下。同样的50次任务,成功24次,成功率48%,平均分从37.8涨到62.6。
第三组:这种分工里,GPT-6Astra真正出手纠正的动作,只占全部控制步骤的14.4%。
也就是说,大脑只改了不到15%的动作,机器人的整体成功率几乎翻了一倍。剩下85%的体力活,全是那个专用动作模型干的。
它不是不行,是用错了地方
再看另一组任务——辨认物体、按语言分类、把积木按顺序摆好这类"动脑子"的活。
这时候GPT-6Astra直接上手,50次成功49次,成功率98%,碾压所有专用机器人模型。反倒是一加动作模型帮忙,成绩还掉到了92%。
这个反差很关键。
GPT-6Astra最擅长的,是"想":看懂指令、认出目标、判断空间关系,发现抓歪了、东西漏了,会停下来重新观察、重新规划。这些认知层面的活,通用大模型一骑绝尘。
但轮到"做":木块放下去塔会不会倒、麻将牌推不推得准、衣服折得整不整——这些需要手感的地方,大模型立刻露馅。搭塔任务它只拿了12分,麻将杠牌直接0分。它知道木块该放哪儿,却保证不了松手的那一刻塔不塌。
这像极了读了一百本游泳书的人
打个比方。一个把游泳理论背得滚瓜烂熟的人,第一次跳进泳池,能讲清楚自由泳的每一个动作要领,但真下水还是会沉。
"知道该怎么做"和"身体真的做得到",中间隔着成千上万次的练习。
机器人也一样。通用大模型的"经验"来自文本和图像,它理解世界靠的是语义;而机器人要的是手感——接触、摩擦、力度、稳定性,这些东西它从来没在真实物理世界里练过。报告里一个细节很说明问题:GPT-6Astra甚至试过用机械臂把整个瓶子扫进桶里,思路挺巧妙,动作却稳不住。
所以这份报告真正的结论,既不是"大模型无所不能",也不是"大模型不行",而是:认知和执行,是两种完全不同的能力,谁也替代不了谁。
放到企业里同样成立
把视线从机械臂移开,会发现同一套结构在组织里天天出现。
一个团队对外呈现的内容体系,真正需要判断的部分其实很少:口径怎么定、哪几条信息必须唯一、哪些内容优先更新。而执行的部分占比极大:把已经定好的信息整理、更新、按节奏发布,动作重复、标准明确、不需要每次重新决策。
问题常常出在这里:该判断的没被认真定一次,该重复的却每次都在重新商量。结果是判断成本被重复消耗,执行又因为标准不一致而返工。把少数判断固定下来,让多数执行按节奏跑,是这套体系能长期运转的前提。
更值得留意的是复利那一层:判断定得准、执行跟得久,这些内容会一层层累积成别人抄不走的资产——今天写下的东西,三年后还在替这家公司说话;而一次性的漂亮产出,三个月后就没人记得了。
3个可以对照的标准
1.判断是否被定过:那些「一年只需要认真想一次」的事,有没有明确的结论和留存下来的版本?
2.执行是否有节奏:重复性的动作,是否有固定节奏和固定责任人,而不是想起来才做?
3.沉淀是否在累积:今天做的事,三年后是否还留在那里、还能被检索到?
结语
回到那两个比例:14.4%的判断,85.6%的执行。少数判断决定方向,多数执行决定能不能走远。一份实验报告之所以值得反复读,是因为它把这件事量化了——能力的差距,很多时候不来自更聪明,而来自分工是否被安排对了。
留一个开放问题:如果把这条比例套到自己的团队,那14.4%的关键判断,现在是谁在负责,又有多久没有重新核对过?
上个月一位做企业的朋友搭了个GEO官网,把企业知识库输进去,现在每天客资都在涨,这套方法公众号「智扣AI」免费分享。