
文 / 安妮
来源 / 节点AI
在具身智能热度空前的高涨浪潮中,人们常常被网络上各种炫酷的视频所吸引:机械臂优雅地整理餐桌、人形机器人流畅地下楼梯甚至跳跃……然而,一旦把这些机器人从光线完美、环境固定的实验室推向光线杂乱、物体形态千奇百怪的现实工厂和家庭,那些在公开榜单上跑出“99%成功率”的模型,往往瞬间陷入动作变形、任务中断的尴尬。
“别被实验室的 Demo 骗了,具身智能今天远没有到它的‘ChatGPT 时刻’。”原力灵机联合创始人兼 CEO 唐文斌在最近的一场具身智能专项分享会上直言不讳。
作为中国最早一批 AI 创业潮的亲历者与领头人,唐文斌从清华“姚班”的技术天才,到带领团队在国际人脸识别大赛上击败 Facebook,再到管理上千台物流机器人协同作业,他对 AI 技术在物理世界的“真假落地”有着独特的看法。
2025 年,唐文斌创立了原力灵机,开启了在具身智能领域的第二次创业。这一次,他们不仅要打造具备通用泛化能力的“具身原生大脑”,更选择做一件看似吃力不讨好的事——联合 HuggingFace 等全球机构,打造一个公益、中立、基于真机的大规模评测平台 RoboChallenge,用真实的数据去戳破行业的泡沫。
从“给机器以视觉”到“让 AI 掌控物理世界”
提及唐文斌,圈内人很难绕开他在旷视科技的传奇经历。
1987 年出生于浙江绍兴的唐文斌,从小就是个对代码极其痴迷的“计算机极客”。初中时他主动毛遂自荐拿到机房钥匙,随后在全国信息学奥赛中一路斩获金牌,高二即被保送至清华大学著名的“姚班”(清华学堂计算机科学实验班),并拿下了首届“Yao Award”金牌。
2011 年,唐文斌与清华同学印奇、杨沐共同创立了旷视科技,这也是中国最早的 AI 创业公司之一。然而,光有“眼睛”还不够。从 2016 年起,唐文斌在旷视内部从零组建并带头抓起了机器人业务。在优衣库上海大仓、宝洁、富士康等巨头的超大型仓库里,他带领团队实现了协同调度上千台机器人高效运转。
这场长达数年的工业实战,让唐文斌比任何人都深刻地体会到:软硬件一体的物理世界,容不得半点虚假。算法跑得再漂亮,机械臂落不下去、接不住货,在商业客户面前就是零分。
原力灵机的“具身原生”解法
2024 年底至 2025 年初,随着大语言模型和多模态 AI 的爆发,具身智能迎来了代际跨越的历史机遇。唐文斌决定与范浩强、周而进、汪天才等长期共事的旷视技术骨干一道,创立原力灵机。

“我们就是一个崭新的公司,但我们也是一个已经做智能机器人做了十年的团队。”唐文斌表示。
面对市场上盲目堆砌硬件、花式表演 Demo 的躁动,原力灵机从一开始就保持着冷峻的清醒。他们没有跟风去做高成本、难落地的人形机器人,也没有挤入特斯拉和 Figure 等企业抢夺的汽车整车产线,而是提出了 “具身原生” 的技术哲学。
在唐文斌看来,很多公司做 VLA(视觉语言动作模型)采用的是“嫁接”思路——拿一个开源的通用多模态大模型(VLM),尾巴上硬生生粘一个 Action(动作)预测模块。这种“外挂式”做法让模型很难真正理解物理世界的因果与空间几何。而原力灵机则与阶跃星辰等大模型底座公司深度协作,直接从多模态基模预训练阶段就嵌入具身物理数据,让大模型在出生那一刻就具备对物理世界的感知与控制本能。
在商业落地上,唐文斌提出了极其务实的“四个标准”:容忍错误(人能兜底)、容忍节奏(节拍不过于苛刻)、适度泛化、长时间作业保障 ROI。
“具身智能竞争的从来不是实验室里的单点 Demo,而是模型、系统、本体、场景全栈一体化的真实生产力。”唐文斌强调。而要让生产力落地,第一步,就是要搞清楚当前技术到底处于什么水平。
戳破“99%成功率”的虚幻
在 2026 年 7 月 19 日的具身智能专项分享会上,唐文斌公布了一组令行业反思的数据与观察。
《节点AI》了解到,目前,绝大多数具身智能团队在宣称自己的算法效果时,往往依赖于开源模拟器或特定榜单。在这些公开榜单上,任务成功率动辄被刷到了 99% 甚至接近 100%。然而,行业内部心照不宣的事实是:这些成绩与真实的物理世界严重脱节。
“我们看到,行业里甚至有某些融资数亿元的高额融资公司,在第三方评测平台上通过各种手段提交作弊成绩,最后逼得官方不得不出面公示取消其成绩。”唐文斌在分享会上直言。
除了刷榜作弊,传统评测在逻辑上也存在根本缺陷——“专家模型误导”。 以往的评测方式,是针对 30 个特定任务单独训练 30 个微调模型,测试时拿这 30 个“专项冠军”去拼凑出一个看起来全能的成绩。这本质上是独立模型的集合,根本无法检验模型是否具备真正的通用泛化智能(Generalist)。
为了给行业找出一把客观、公允的“尺子”,早在 2023 年 7 月,唐文斌团队便与开源社区巨头 HuggingFace 联合发起了 RoboChallenge 评测平台,并获得了启明创投等机构与学术界的支持。

RoboChallenge 从诞生之日起就坚守极其苛刻的原则:
真机实测:拒绝纯虚拟模拟器的投机,所有算法必须在真实的物理机械臂上跑闭环。
利益中立:平台统一采用 4 款通用的科研机型,原力灵机不纳入任何自有商业机型,杜绝“带私货”。
公益开放:联合工信部信通院,在联合国 AI for Good 大会上发布 EAI Bench,致力于成为连接全球开发者的公共基础设施。
如今,RoboChallenge 已完成数万次真机测试,吸引了来自中国、美国、新加坡、日本、阿联酋等全球十余个国家的超 500 名开发者、超 500 组算法深度参与,并成为 CVPR、ICRA 等顶级国际学术会议的官方赛事平台,一跃成为全球规模最大的在线真机评测平台。
在最新的分享中,唐文斌透露了 RoboChallenge V2 的实测数据显示,在单任务模型下,机器人处理柔性物体的成功率仅有 64%。
“64% 的成功率听起来不那么好看,但这就是物理世界的真相。”唐文斌说。
为了证明评测的严谨性,原力灵机也在该平台上提交了自身研发的 M05 具身模型进行“跑分”测试。测试表明,M05 在各项指标上均展现出极强的泛化水准,成为了 2026 年 7 月前国内公开开源具身模型中的佼佼者。但唐文斌依然呼吁:“模型公司不应该自嗨,大家都要把模型放到真实公平的真机平台上来晒一晒,客观比较,务实迭代。”
具身智能远未到“ChatGPT 时刻”
当前,不少资本和舆论习惯将具身智能的现状类比为大语言模型爆发前的“GPT-2 时刻”甚至“ChatGPT 时刻”,认为通用机器人走入千家万户指日可待。
对此,唐文斌非常冷静:“我们今天很显然很难去讲说,我们是不是迎来了所谓的 ChatGPT 时刻。对不起,我们今天还没有。”
在他看来,大语言模型处理的是一维文本序列,数字世界的错误成本极低;自动驾驶处理的是二维平面的移动,而具身智能要在三维物理空间中实现高自由度的多连杆交互、触觉感知与动态反馈,其复杂度比自动驾驶高出至少一个数量级。
“任何一家模型公司,如果你不知道如何去评测,你是不可能把模型做好的。”唐文斌点明了评测对于技术突破的底层价值,“这就好比给赛车打分,如果没有一条精准的计时跑道,工程师根本不知道改动哪一个齿轮能让车跑得更快。”

要跨越当前的瓶颈,行业必须依赖真实的 Scaling Law(规模法则)。这不仅是模型参数量的扩大,更是高质量物理交互数据的呈数量级增长。
唐文斌认为,具身智能正在经历从“Demo 1.0”向“产业 2.0”的代际跨越:1.0 时代:拼参数、拼炫酷视频、拼单一场景微调,模型离了特定的灯光和摆放就失效。2.0 时代:拼通用泛化能力、拼长时记忆(如 60 秒以上的长程连续指令)、拼跨硬件本体的适配能力,以及拼真实工业/服务场景中的长时可靠性。
为了破除行业硬件接口碎片化、算法团队各自重造轮子的难题,原力灵机不仅构建了 RoboChallenge 评测平台,还开源了基于 PyTorch 的 VLA 工具箱 Dexbotic,以及具身原生开发框架与量产工作流,试图把具身智能的工程化底座打牢。
让产学研在真机上闭环
在唐文斌的规划中,RoboChallenge 绝不仅仅是一个简单的比赛或打分工具,它的终极形态是连接全球具身智能社区的公益基础设施。
“过去学术界搞研究,受限于昂贵的硬件和缺乏真实数据的难题;工业界做应用,又苦于拿不到具有前沿泛化能力的算法。”唐文斌指出。
通过 RoboChallenge 这一中立公益平台,高校学者可以在远程真机上验证最前沿的端到端算法;场景方(如物流仓库、制造工厂、家政服务机构)可以清晰地看到当前技术真实的成功率边界在哪里,从而精准设计“人机协同”的落地流程;而模型公司则能通过定期的“真机硬碰硬”,找到模型的弱点并快速迭代。
从 2011 年在清华宿舍里萌发“给机器以视觉”的野心,到如今领航原力灵机、为全行业搭筑 RoboChallenge 评测基座,唐文斌的身上始终保持着一种极客特有的务实。
具身智能通往通用物理智能的道路注定漫长而陡峭。在浮躁与赞誉充斥的行业早期,原力灵机选择了一条最硬核的路:不讲虚幻的故事,不做易碎的 Demo,用“真机实测”直面 64% 的真实痛点,用“中立公益”凝聚全球开发者的力量。
正如唐文斌所言,机器人走进现实生活不是一场靠精美宣发就能赢下的百米冲刺,而是一场依赖客观评测、数据积累与工程演进的马拉松。当水分被还原,当虚标的成功率被清空,中国具身智能的“物理大模型时刻”,才真正开始从实验室走入现实场景的千行百业。
*题图由AI生成
节点声明:本内容为作者独立观点,不代表节点财经立场。未经允许不得转载,文中内容仅供参考,不作为实际操作建议,交易风险自担。