• JYlo938
第一科技网 首页 资讯 查看内容

银河通用实测GPT-6 Astra之后,中国具身智能应该看什么?

时间:2026-09-18 17:53:53 来源:https://www.com320.com/news/show-86216.html 收藏 阅读量:9435   会员投稿

桌面上散落着一组数字木块,机器人需要理解数字大小,把它们从左到右排列成尽可能大的数字,并调整好每块木块的方向。

这道题看起来不复杂,但对靠模仿轨迹训练的具身模型却很难。机器人不仅要复现动作,还要记住刚才的顺序,理解数字大小,最后才是伸手摆放——它得先想清楚,再把想法变成动作。

OpenAI最新发布的GPT-6 Astra,在这类任务中展现出了明显不同的能力。一份由中国团队完成的第三方评测,把Astra放进机器人仿真环境,测试它能否理解任务、操控机械臂,以及在失败后自行恢复。

报告很快在GitHub公开,而完成这项评测的团队中,就有银河通用的研究员。

为什么是银河通用率先发现

9月12日,技术报告《GPT-6 Astra as an Embodied Policy》开源。公开作者信息显示,银河通用研究员苏佳奕为共同第一作者之一,张直政和王鹤为通讯作者。

从GPT-6 Astra发布到报告公开,前后不到两周。短时间内完成任务选择、实验对齐、轨迹评估和报告整理,靠的不只是反应速度——评测环境、控制工具和数据分析方法必须提前建好,新模型发布后才能迅速接入。

这正是银河通用此次值得关注的地方。外界通常通过机器人本体和应用案例认识一家具身智能企业,仿真评测体系却不容易被看见。它像埋在水下的基础设施,平时负责训练、验证和寻找模型边界,等到新模型出现,才显示出价值。

需要说明的是,这不是OpenAI官方评测。报告是在RoboDojo和RoboLab仿真环境中完成的第三方实验,结果反映的是特定任务、特定设置下的模型表现,不能直接外推到所有机器人和现实场景。

报告把GPT-6 Astra放在两种模式里测试。一种是Direct模式,由Astra直接生成机械臂末端动作;另一种是混合模式,先由具身模型π?.?提出动作,再让GPT-6判断是否需要纠偏。

在RoboDojo选取的10项双臂任务中,混合模式获得48%的成功率,GPT-6AstraDirect为26%。这组结果说明,通用大模型擅长理解目标和判断对错,具身模型则提供更接近物理交互的动作经验,两者配合比让GPT单独完成所有动作更稳定。

更吸引眼球的是RoboLab补充实验。报告选取10项单臂Franka任务,每项测试5次。在这个特定的零样本任务子集里,GPT-6AstraDirect在50次测试中成功49次,混合模式成功46次,π?.?成功18次。

49/50是一个很强的结果,但边界也要写清楚:它来自报告选定的RoboLab任务子集,任务以语义识别、抓取和放置为主,不等于GPT-6在所有陌生机器人任务上都达到98%的成功率。

真正值得注意的,是它在语义理解和失败恢复上的表现。机器人能按语言区分目标物,记住排序要求,也能在发现任务未完成后回头检查。这说明通用大模型正在把数字世界里的推理、视觉理解和纠错能力带进物理任务。

能完成任务,不等于能把活干好

成绩亮眼,不代表机器人已经可以直接由超大模型接管。

报告显示,涉及搭塔、杠牌等精细接触任务时,GPT-6 Astra Direct表现明显下降。理解“要做什么”和稳定完成动作是两回事:前者依赖语义和视觉判断,后者还涉及力控、接触稳定性、实时反馈和本体性能。

仿真环境与真实世界还有一个关键差异。该评测按控制回合运行,模型返回动作之前,仿真环境无需像真实流水线一样持续推进;报告统计的物理执行时长也不包含模型响应延迟。但工厂里的流水线,不会停下来等云端回复。

按照此次评测采用的云端调用方式,GPT-6 Astra尚未体现直接端侧部署能力,进入真实产线还要面对响应延迟、网络稳定性和推理成本等问题。

因此,这次评测给出的结论更接近“强,但不完整”:GPT-6在任务理解和陌生场景泛化上显示出优势,动作质量、实时控制和端侧部署仍要依靠具身模型、本体系统和工程优化。

据业内人士估算,OpenAI自2025年起通过数据采集渠道购买的具身数据可能达到千万小时量级,相关数据与算力投入可能达到百亿元人民币级别。这不是 OpenAI 官方披露的数据,但多个信源交叉印证了同一个方向:OpenAI 在2025年初于旧金山悄悄搭建了人形机器人实验室,最初雇用约100名数据采集员,通过远程操控机械臂执行叠衣服等任务;到2026年,实验室规模已扩大四倍多。9月3日,山姆?奥特曼公开确认OpenAI正在做人形机器人,招聘页面上同时开放了19个机器人相关岗位,其中至少4个聚焦执行器 —— 这是一家公司要做硬件、而不只是做模型的信号。

资本的下注更加直接。Figure AI 在2025年9月完成超10亿美元C轮融资,估值从一年前的26亿美元飙升至390亿美元,成为全球估值最高的人形机器人公司。2026年9月,Figure AI又承诺投入35亿美元租用算力,与Nscale合作获取最多10万GPU。具身智能模型公司 Physical Intelligence 在 2025年11月完成6亿美元融资后估值达56亿美元,后续报道显示其估值已进一步冲到110亿美元。

这些数字放在一起,勾勒出的是一种“用资本密度买时间”的竞争方式:美国公司在模型、数据、算力和本体上同时重兵投入,试图把大模型时代积累的能力,平移到物理世界。

中国的胜负手,不只是更大的模型

面对这样的投入规模,中国首先要补长期投入,但不能只学对方堆算力、买数据。

具身智能同时涉及大脑模型、运动控制、本体硬件和真机数据,任何一环短缺都会影响最终表现。2026年的政府工作报告提出建立未来产业投入增长和风险分担机制,相关政策也在推动国有企业开放真实场景,让耐心资本承担更长周期的研发风险。

更关键的是,要把中国的制造业场景真正用起来。

在西门子数控(南京)有限公司电子工厂,银河通用重载机器人已经进入表面贴装生产线,承担主板搬运工作。据央视财经报道,该产线每月需要搬运的主板总重量约18万公斤。机器人可承载50公斤负载,并通过动态环境感知识别物料位置变化,在真实车间中连续作业。

传统定制化AGV也能搬运物料,但往往需要增加控制逻辑、定位设施和硬件投入,适用任务相对固定。西门子南京工厂相关负责人认为,人形机器人无需大幅改造现有设备,同时保留扩展更多技能的可能性。

这个案例把中国的场景优势说得很具体。机器人完成一次动作,只能证明技术可行;在既有产线中持续运行,才会形成关于光线变化、物料偏移、人员干扰和设备磨损的真实数据。这些数据再回流模型,才能推动下一轮迭代。

银河通用与宁德时代的合作,又把这条路径向规模化推进了一步。2026年3月,GalbotS1通过宁德时代产线验收,随后在模组与电池包生产环节开展7×24小时常态化作业,并从试点逐步扩展到近百台部署。

西门子检验的是机器人能否进入复杂的既有工厂,宁德时代检验的是同一套能力能否长期运行、批量复制。中国要对冲海外巨头的高投入,不能只比模型参数,更要把硬件、数据、模型和应用连成闭环。

而这个闭环长什么样,银河通用恰好提供了一个观察样本。

评测端,它能够较快完成GPT-6Astra的系统测试;模型和数据端,它持续建设具身大模型、仿真平台及数据基座;产业端,机器人已经进入西门子南京工厂和宁德时代产线,在真实作业中接受稳定性和规模化检验。

这几项能力不能互相替代:评测让企业看清模型边界,工厂检验模型能否转化为生产力,持续运行又为下一轮训练提供数据。

最近具身智能行业围绕出货量、收入和项目成色出现不少争议。讨论可以继续,但评价标准应尽快回到可核验的事实。新华财经在调研中提出,要把竞争拉回模型能力、数据沉淀和工程落地。西门子每月18万公斤的搬运需求、宁德时代7×24小时作业和近百台部署,正是比口号更有价值的指标。

GPT-6 Astra让行业看到海外大模型向物理世界推进的速度。中国要做的,是集中资源补足模型和数据能力,同时把真实工厂变成持续运行的训练场。多干事、少争吵,力气最终要落在技术和产线上。

声明:以上内容为本网站转自其它媒体,相关信息仅为传递更多企业信息之目的,不代表本网观点,亦不代表本网站赞同其观点或证实其内容的真实性。投资有风险,需谨慎。

Es916
精彩阅读