Astra 抓积木:通用大模型的第一次真机臂大考
上周四,一家 YC 孵化的公司做了一件朴素到近乎莽的事:把 GPT-6 Astra 接上一对真实的机械臂,让它抓积木、放碗里。没有专用 VLA 模型,没有微调,没有示教数据——就是你我在终端里调用的那个 API,多喂了三路摄像头画面。
做这件事的公司叫 Robocurve,自我介绍只有一句:”Real-world evaluations of physical AI”。他们开源了 inspect-robots 评测框架(287 星,6 月底建仓),跑过 Opus 5 的汉诺塔、跑过积木堆叠的测试时扩展曲线。这次的报告是 9 月 4 日发的《GPT-6 Astra on robotic manipulation》,前情是他们自己那期 Fable 5 对 Fable 5.1 的对比——同一对臂、同一套任务,Astra 补考入场。考场没换。
考场长什么样
硬件是双臂 I2RT YAM,每臂 6 自由度,平行夹爪。每一步决策,模型看到三路画面(顶部、左腕、右腕)加本体感知,输出绝对末端位姿去执行。每条轨迹最多 20 次模型调用,thinking 档位中等,机械臂限速到 25%。三个模型、两个任务、每任务每模型 20 次试验,共 120 次——全部有视频和转录,可逐条回看。
flowchart LR
A[三路摄像头加本体感知] –> B[通用 LLM agent
至多 20 次调用]
B –> C[绝对末端位姿指令]
C –> D[双臂执行
限速 25%]
D –> E[人工按 0 到 4 打分]
E –> A
任务一:把红色积木放进碗。结果一边倒。Astra 20 次成了 19 次,Fable 5.1 成了 8 次,Fable 5 成了 1 次。平均用时 2.5 分钟对 6.8 分钟,单次成本 0.94 美元对 2.12 美元。三个模型用的是同一份牌价(每百万输入 10 美元、输出 50 美元),Anthropic 侧没开缓存、OpenAI 侧自动缓存了约五分之一的输入——报告特意说明,Astra 的成本只会被高估、不会被低估。输出 token 的差距更扎眼。Astra 平均 2100,Fable 5 是 19200。差 9 倍。
xychart-beta title “积木入碗完成率 单位百分比” x-axis [“Fable 5”, “Fable 5.1”, “Astra”] y-axis “完成率” 0 –> 100 bar [5, 40, 95]
任务二:把拼图块嵌进凹槽。这里的风度比成绩重要。Astra 成了 2 次,Fable 5.1 也成了 2 次——打平。平均推进阶段 Astra 2.00,反而低于 Fable 5.1 的 2.35。报告原话:”It reaches the groove and stalls at the same final step Fable does.” 两个模型卡在同一步。简单的任务拉开三倍的差距,难的任务一起卡在最后一毫米。
值得学的是它的认错方式
报告末尾的 Limitations 一节列了四条:Astra 的试验比 Fable 晚两天跑、没有交错;积木任务里 Fable 用的是 3 号台架、Astra 用 1 号(3 号后来不可用);打分是操作员目测、且知道正在跑哪个模型;成本按牌价算。HN 上 180 分的帖子里,被顶起来的评论是:”limitations that they state shouldn’t really make much of an impact. But it was nice of them… to mention those. Kudos to them!”【直引】一个评测把自家缺陷列得比结论还全,这在真机评测里算稀有物种。
【判断】这条新闻真正的分量不在”Astra 赢了”,而在模板本身:120 次试验、全量视频、全量转录、成本按时计价、缺陷主动披露——具身评测第一次有了可回放的公共记录。评论区吵的则是另一件事:折叠衣服那类家务到底卡在哪。高票的回答是把瓶颈从”智力”挪回”机械”:机器人不是不会叠,是”叠七天就得返修”,”It would be a tough sell to have to bring in a 100kg robot for servicing every few weeks.”【直引】
【推论】通用模型与专用 VLA 的界线,这个实验只掀开了一角:会看的部分(把画面变成动作序列)通用模型已经能做,卡壳的部分(最后一毫米的插入)它和专用模型一起卡。真机数据这条线,往后会比跑分好看。
