━━━━━ 正文从此处全选复制 ━━━━━

FutureX · Physical AI

今日要点

· 浙大与达摩院给 VLA 挂 40M 纠错器,扰动恢复成功率抬到 68.3%

· 光象科技的世界模型训练完退出部署,LIBERO-PLUS 拿到 80.3%

· 智元敏实的塞尔维亚工厂 9 月 4 日首批机器人下线出货

· 日产 Smyrna 车身车间上 AMR,64 个叉车岗位不再补员

· Figure 众包 App 收上 1600 万条视频,已付创作者 1500 万美元

· XDOF 出隐身三个月,B 轮估值谈到约 12 亿美元

▎ 论文进展

给 VLA 装一个 40M 的刹车,让它边做边纠错 · vla

想象一台机械臂正把积木往碗里放,这时有人突然把碗挪走了——模型的摄像头明明已经看到了新画面,可它的手却还在照着几百毫秒前生成的旧动作往下执行。浙江大学 ACES 实验室 OmniAI 团队和阿里巴巴达摩院盯上的,正是动作片段(action chunk)之间这段开环盲区。他们没有去动主干网络的权重,而是在推理链路外面挂了一个大约 40M 参数的小模块 Corrector:它在 latent space 里把视觉特征的预期变化和实际变化拿来比对,一旦偏差持续存在,就把还没执行完的动作队列清空,再把这份偏差转成梯度信号,指导那一次重新推理去做恢复。放到真机 AgileX PiPER 上跑九项任务,平均成功率从原来的 55.6% 一路升到了 73.3%,而在人为把目标物体挪走这种扰动测试里,恢复成功率更是从 40.0% 涨到 68.3%。省下来的不只是失败率这一项:SmolVLA 在 horizon 设为 10 的条件下,成功率从 61.90% 提升到 73.00%,与此同时平均每次要调用的 policy call 反而从 19.27 次降到了 15.64 次,其中 83.7% 的中途截断都发生在抓取、对齐、插入这几个最关键的动作阶段。[1]

世界模型只在训练场上岗,机器人干活时先行退场 · world-model

就算把相机视角换了、把光照背景改了、再加上传感器噪声干扰,LIBERO-PLUS 上依然能跑出 80.3% 的平均成功率,而对照组 Fast-WAM 只有 51.5%。这背后是光象科技和清华大学李升波教授课题组做的 Phi-WM 1.0 ActEffect,它把受控世界模型的使用范围限定在训练阶段:策略网络一次性给出前馈、粗提案、精修三个完整版本的动作,世界模型则在冻结的 DINOv3 特征空间里分别预测这三种动作各自会带来什么后果,拿去跟真实的未来逐一比对,要求精修版本要比粗提案好、粗提案要比前馈好,再把这套排序结果压回策略网络的权重里去调整。等训练一结束,世界模型和那个负责预测未来观测的分支就一起被摘掉了,实际执行的时候既不再展开未来,也不再搜索候选动作。在 29 维动作空间的 RoboCasa-GR1 任务上,它拿到了 67.5% 的平均成功率,比排第二的 ABot-M0 高出 9.2 个百分点;如果去掉后果反馈这一环,LIBERO 上的表现会从 98.8% 掉到 97.0%。这套做法真正省下来的,是产线上每一台设备每走一步都要付出的推理开销。[2]

把"谁先过门口"形式化,多机器人导航拿到第一份统一分类 · autonomy

两台配送机器人同时朝一扇门冲过去,几辆无人车同时开到没有信号灯的路口,走廊里迎面相遇的一群机器人——这类摩擦场景,被发表在 Autonomous Robots 上的这篇综述统一命名为 Social Mini-Games。作者把它定义为这样一种情形:两个以上智能体各自的最优轨迹在同一时间段里会撞在一起,必须有一方主动让步才能解决。他们用部分可观测随机博弈来给这类情形建模,并给出了一套几何判据,用来判断一段普通的导航过程什么时候会滑入 SMG 的范畴。他们诊断出的问题根源在于,学科之间的割裂拖慢了对"最后一公里"问题的解决——人类只靠稍微调整一下速度就能优雅化解的冲突,机器人到现在都还学不会。[3]

开源·工具·评测

· ABC 数据集:XDOF 联合 UC Berkeley BAIR 把它放了出来,公司自己说这是目前规模最大的高质量机器人训练数据集,做法是让人类采集者戴上穿戴传感器、通过远程遥操作去录制叠衣服、压平纸箱这些日常任务的动作 [4]

· VLA-Corrector:浙大与达摩院把代码和项目主页都开放了出来,这个只有 40M 参数的旁路模块可以直接挂到 π0.5、SmolVLA 上用,不需要动主干权重 [5]

· Magic-VLA K02:魔法原子的通用具身大模型在 IFA 上第一次亮相欧洲,公司说打算在今年 10 月开源这个基础大模型 [6]

▎ 融资与交易

XDOF | B 轮洽谈 | 估值约 12 亿美元 · adjacent ⚠️ 传闻口径

领投方是 8VC,但具体条款还没定下来,融资总额以及估值里是否含新钱都还没得到确认。这家做真实世界遥操作数据采集的公司由 UC Berkeley 出身的 Philipp Wu(担任 CEO)和 Fred Shentu(担任 CTO)在 2024 年创立,今年 6 月才刚拿到 7000 万美元 A 轮,投资方里有 Thrive Capital、Andreessen Horowitz、Lux 和 Spark Capital。本来公司没打算这么快就再融一轮,是年化收入眼看逼近 5000 万美元的增长速度把投资人吸引过来的。两位创始人读博期间做的那套低成本遥操作系统 GELLO,是这家公司的技术起点;现在投资人干脆把它比作机器人行业的 Scale AI。[7]

泉智博 | B 轮 | 数亿元 · hardware

这轮由毅达资本和国泰海通开元领投,西证股权跟投,距离 7 月那轮 A+++ 才过去一个月,算下来是这家无锡关节模组公司不到两年时间里融到的第 8 轮。资金将用来把产能爬坡到百万级,同时研发下一代高扭矩密度的关节。公司在 2025 年的出货量已经突破了 10 万台,2026 年 6 月单月发货就超过了 6 万台,上半年的发货量甚至已经超过去年全年;自动化率超过 85%,一次合格率也稳定保持在 96% 以上。领投方毅达资本给出的判断是:关节模组要占到整机成本的 30%-60%,是国产供应链能否自主可控的关键一环。智元、乐聚、灵心巧手既是它的客户,也是它的股东。[8]

黑漫科技 | 半年三轮 | 累计近亿元 · hardware

毅达资本 4 月先入股,紧接着又领投了新一轮,股东名单里还能看到乐聚机器人、东方精工、兆丰股份、申昊科技这四家产业方。创始人杨子赫做灵巧手的念头,其实是在西南印度洋种下的:跟随"大洋一号"科考船作业时,ROV 上那两根手指的夹爪根本抓不住姿态复杂的海底目标,一次下潜好几个小时,最后只能空手而归。9 月 4 日,公司发布了可变构灵巧手大圣 1(SG100),4 根手指、11 个主动自由度,重复定位精度最高能到 0.03mm,整只手能负载 24kg。另一款 WA100 被公司称作全球首款防水灵巧手,其中深海工程版最大能下潜到 10000 米作业,民用版则用食品级材料,主要面向厨房、卫浴这类场景。⚠️ 厂商口径[9]

法奥机器人 | A 股 IPO 辅导备案 | 辅导机构国泰海通 · industrial

江苏证监局昨天完成了登记,董事长姚庭持有公司 24.74% 的股份。这家 2019 年成立的苏州公司主攻智能感知型协作机器人,号称是第一家把谐波减速器、电机、控制器这些核心零部件全都自己研发的协作机器人厂商,今年 3 月刚完成股份制改革。2025 年,它的协作机器人接到了 1.3 万台订单、出货 1.1 万台,其中海外出货 3200 台;到了 2026 年上半年,订单量同比涨了 120%。此前经历的六轮融资里,投资方包括顺为资本、高瓴创投、阿里巴巴、美团龙珠、源码资本、国寿资本。[10]

▎ 商业化落地与部署

塞尔维亚 Šabac 工厂首批人形机器人下线出货 · humanoid

9 月 4 日,第一批机器人离开了产线走向出货环节。这家由敏实与智元合资建成的塞尔维亚首座人形机器人工厂,在上周投产之后,只用了一周多就走到了从投产到出货这一步,产线上目前跑着两款人形机器人加一款四足机器人。这些机器人出厂时其实还是通用设备,具体干什么活要靠后续搭载的 AI 和专用软件,按部署的地方来分配任务——大致的路径是先进工业场景,再逐步进入家庭。工厂总经理 Djin Mao 对 RTS 表示,他们的目标不只是造机器人,还要在当地培养出一批技术人员;生产主管 Dejan Babic 就曾专门去嘉兴接受了 30 天的培训,参与过试生产,也经手过从上料到成品出库的整个物流环节。用工规模的规划超过 200 人。不过产能这个数字前后对不上:RTS 报道里给出的年产规划是 3000 台,但工厂投产那会儿公布的目标却是年产逾 5000 台。敏实过去在塞尔维亚做的是汽车零部件生意,而这次做机器人则拉动出了一条当地原本没有的供应链,涉及传感器、电池、电机和晶片。[11]

日产 Smyrna 工厂上 AMR,64 个叉车岗位做完不补员 · industrial

每台的载重大约在 4190 磅,最高能跑到时速 4.5 英里,只要其中一台落后于任务进度,另一台就会立刻顶上去补位。田纳西州 Smyrna 车身车间跑起来的这批 AMR,来自罗克韦尔自动化旗下的 OTTO——罗克韦尔在 2023 年 10 月花了大约 6 亿美元把它的母公司 Clearpath Robotics 收购过来,同款设备目前也在福特、GE、好时和卡特彼勒的工厂里运转。日产把这个项目列为今年最大的一笔降本投入,最终会替代掉 64 名叉车和拖车操作工原来做的工作。受影响的员工不会被裁掉,可以留在公司内申请别的岗位,其中一部分人甚至有机会转去接受培训、操作工业机器人;但等这一轮过渡完成之后,物料搬运这些岗位就不会再补人了。中间软件也出过问题,有一次系统把两台机器人同时派到了同一个位置,日产后来找供应商把程序改了过来。目前六个部署阶段才刚走完第一个。[12]

魔法原子在 IFA 做欧洲首秀,签下斯洛文尼亚邮政 · humanoid

在追觅的智能制造工厂里,MagicBot D1 已经在承担车间物料搬运和产线上下料的工作,这算是展台之外实实在在的落地证据。9 月 4 日,魔法原子在柏林一口气拿出了三款新品:全尺寸人形机器人 MagicBot X1,膝关节峰值扭矩超过 350N·m、极限能到 450N·m;工业级轮式人形机器人 D1,作业高度能覆盖 80 到 230cm,配了一条 7 自由度的力控机械臂,力控精度做到了 0.5N;还有一款轻型四足机器人 MagicDog T1,自重 19kg,能持续负载 15kg 级重量。商业化方面,公司已经和斯洛文尼亚邮政谈成了合作,去做当地分拨中心的柔性分拣,另一款四足 MagicDog Y1 则被用在欧洲能源厂区和电力场站做巡检。公司方面透露,在手加上跟进中的订单已经超过 11 亿元,预计 2026 年营收能到 5 亿元,海外收入占比要从 2025 年的 26% 提升到 50%,CE-RED 整机安全认证预计在第四季度完成。⚠️ 厂商口径[13]

银河通用 G1 在 IFA 全程无人在环取货 · embodied

在柏林 Messe 25 号馆 IFA Next 的 160 号展位上,一台 G1 从货架取物、穿过拥挤的空间、操作物体,全程没有任何操作员介入。这台机器人重 85 公斤,是一台轮式半人形机器人,身高 173cm,臂展 190cm,躯干伸展开来能触及 240cm,头部装了双目相机,躯干配了四路 RGB 摄像头,腕部有深度相机,底盘则装有激光雷达和八个超声波传感器,还带云端连接,用来做模型更新和远程监控。展台上的欧洲买家不用面对美国那道门槛:7 月 28 日,美国 FCC 已经把外国制造、重量超过 2 公斤、同时具备环境感知传感器、200kbps 以上无线连接能力以及自主导航软件的移动机器人纳入了涵盖清单,这意味着新型号不再有资格获得进口、营销和销售所需要的设备认证,不过已经拿到认证的旧型号不受影响。展会现场那台机器人的参数,恰好逐条对上了这份定义列出的三项条件。[14]

▎ 产业动态

余凯:地平线明年要在国内高阶自驾晶片市场超过英伟达 · autonomy ⚠️ 计划口径

"干到今天的话,我们是行业的第二名,仅次于英伟达。"9 月 5 日在亚布力企业家论坛上,地平线创始人兼 CEO 余凯这样描述公司在大算力自动驾驶晶片领域的位置,并把明年的目标定在超过英伟达——需要说明的是,这只是余凯本人给出的一个计划性表态,目前还没有独立数据可以印证。根据地平线官方发布的一张海报,在中国自主品牌乘用车智驾晶片市场,地平线以 31.94% 的份额保持第一,英伟达以 29.38% 紧随其后;而随着征程 6 系列进入大规模量产,地平线在支持城区 NOA 的晶片供应商中份额已升至 22.82%,排在第二位。余凯同时还透露,他孵化的地瓜机器人最新一轮融资的估值已经超过 30 亿美元,业务覆盖从扫地机、割草机到人形机器人的计算需求,这块业务的对手依然是英伟达。[15]

小鹏发布 X-Mind,把世界模型塞进大驾驶模型内部 · world-model

在真正输出动作之前,先在"脑子里"跑一遍时空推演——这就是 X-Mind 给车端智能体加上的一条视觉思维链。这个框架用一种叫 Recurrent Block Diffusion 的方法,在单次前向传播里跨层级逐步去噪,最终生成一张紧凑的抽象草图,规划器再根据这份对未来物理场景的预测,去推导出自车该走的轨迹。小鹏的看法是,目前主流的方案还停留在从感知直接映射到动作的反应式思路上,这就好比司机只盯着眼前那一帧画面就去踩油门;而如果单纯靠文本去推理,又表达不清复杂环境的几何关系,直接去预测未来的原始图像则会带来大量没什么用的高频冗余纹理。今年 6 月,在丹佛举行的 CVPR 2026 具身智能基础模型部署 workshop 上,小鹏集团通用智能中心的负责人第一次公开展示了这套完整的技术路线,并把主动推理、可控生成、长时序预测列为一个高性能世界模型必须具备的三项能力。今年上半年,这个团队已经先后发布了 X-World、X-Foresight、X-Cache 三份跟世界模型相关的研究报告。[16]

Figure 上线 Index,把普通人的家务视频变成训练数据 · humanoid

这个产品 8 月 25 日正式对外开放,到目前为止已经收到超过 1600 万条视频,投稿来自 108 个国家,下载量达到 26.4 万次,每周活跃用户有 4.4 万。系统每秒钟能处理 30 分钟的视频,换算下来相当于每天要上传大约 4.9 年的人类活动画面;每 1000 小时的数据平均下来能覆盖 373 个不同的任务、1146 个被操作过的物体,以及 116 种不同的环境。Figure 已经向它称为 Creators 的贡献者们支付了 1500 万美元,并承诺还要再投入超过 10 亿美元来扩大数据采集和算力规模,目标是在一年内把体量做到现在的 100 倍。原始视频要先经过五级清洗流程,处理完再拿去喂给驱动 Figure 03 的那个 VLA 模型 Helix。之所以要做这件事,是因为第三方数据供应商根本给不出公司想要的那种多样性和质量。这个项目其实是在代号 Project Go-Big 之下秘密开发了四个月才推出的,而就在上周,Figure 刚刚和 Nscale 签下一笔 35 亿美元的算力协议,一周之内接连公布的这两笔重投,指向的是同一个瓶颈。[17]

深圳出台 2026—2028 年智能机器人产业方案 · adjacent

深圳市工信局联合科技创新局印发了《深圳市推动智能机器人产业高质量发展工作方案(2026—2028 年)》,方案定下的目标是到 2028 年要形成"两区两中心":一是全国最具活力的智能机器人创新企业集聚区,二是全球领先的软硬件配套集聚区,此外还要建成国际机器人友好示范城市中心和粤港澳大湾区机器人开源生态中心。技术攻关方向点名了具身智能自主生态工具链、具身智能模型,以及人形机器人本体和核心零部件的自主化。招商方向写得更具体,明确要把具身智能大模型、灵巧手、行星滚柱丝杠这三类企业引到深圳来发展。方案里还提出要推动国产操作系统在机器人上的应用,把 ROS 核心工具包的功能迁移过来,并用"揭榜挂帅"的方式鼓励企业先从轻量化场景切入。[18]

奥尔特曼:OpenAI 肯定会研发人形机器人 · humanoid ⚠️ 演讲口径

"我们肯定会研发人形机器人,我们也会做其他形态的机器人。"OpenAI CEO 萨姆·奥尔特曼在《Sources Podcast》里这样说道。他给出的理由是,现实世界很大程度上是按照人的身体结构来设计的,无论电脑还是汽车都是照着人的尺寸做的,不过他紧接着又补了一句:机器人的形态其实并不是最重要的事,真正关键的是机器人大脑。当人形并没有实际优势的时候,OpenAI 会给特定用户设计不那么拟人化的机器。他把近期的落点划在了数据中心的建设与维护这类工业场景上,而不是普通家庭;至于面向个人用户的通用机器人,那要等到长期以后才会实现。OpenAI 今年已经成立了机器人部门,招聘信息里涵盖了定制机电执行器、仿真流程和机器人数据采集这些方向。[19]

USDOT 发布 2026—2030 财年自动驾驶国家战略 · autonomy

这份名为《America Leads》的战略,把商用卡车法规、安全标准、应急响应和跨州数据协调统统排进了联邦议程,时间跨度一直排到 2030 财年,是在 NHTSA 2025 年 4 月那份框架的基础上继续往前推进。对货运行业影响最大的一项,是 FMCSA 正在推的一项规则制定,目的是把现行商用车法规里那些默认驾驶室必须有人的条款,跟真正必要的条款区分开来。与此同时,NHTSA 还在准备一份 ANPRM,打算给自动驾驶系统的能力设定一套客观的性能标准;USDOT 称这将是自动驾驶能力方面的第一个安全标准,但也明确说这只是早期的一步。分工方面维持原样不变:NHTSA 按机动车设备来监管自动驾驶系统,FMCSA 负责装了这套系统的卡车和客车的运营及安全监督,州和地方政府则依然保留着驾照发放、执法和路权规则方面的传统权限。具体要求还得等提案规则出台以及公众意见征集程序走完。[20]

ICE 计划采购机器狗,隐私团体反对 · adjacent

上个月流出的一份采购规划文件写明,移民与海关执法局打算花 100 万到 200 万美元去买波士顿动力的 Spot,说是要提升态势感知和危险评估能力;到了本周,它又发出了一份市场调研通告,问的正是关于"四足无人地面车辆"的信息。监督技术监督项目的传播总监 Will Owen 对此表示:"ICE 最不需要的,就是一条能开门的、带摄像头的机器狗。"波士顿动力的发言人则回应说,Spot 的典型用途是有毒气体检测、未爆弹药检查、可疑包裹排查、搜救以及灾后结构评估,并强调任何想要武器化的尝试,都被公司条款、伦理准则,以及那封由波士顿动力牵头、联合五家同行共同签署的反武器化公开信明确禁止。ICE 方面的发言人则表示,这项技术不会取代执法人员及其判断。[21]

玄创推出新一代防爆轮式巡检机器人 · embodied

整机同时拿到了 Ex db eb mb ib ⅡC T6 Gb 和 Ex tb ib ⅢC T80℃ Db 这两项防爆认证,还有 IP66 防护等级,机身宽度只有 580mm,能顺利通过厂区里 700mm 宽的通道,四轮八驱的全向底盘让它能横向移动,也能原地掉头。端侧算力达到 157 TOPS,可以并行跑多模态推理,用来做智能读表、设备测温和跑冒滴漏检测,充满电能续航 8 小时,还支持自主回充。公司自研了一套叫 XBOTAEGIS 的架构,分成三层:最上层负责理解任务并做决策,中间层校验巡检路径和动作是否合规,最底层则是一道常驻本体的安全屏障,一旦识别出有风险的指令,就能在毫秒级把机器锁止制动。继在中石油拿下超百台订单之后,公司又把这套方案落地到了储气库和氯碱厂区,后者的装置区通道两侧留出的余量甚至不到 5 厘米。创始人兼 CEO 傅喆是这么说的:"防爆认证只是入场券,真正难的是理解作业流程和安全规范。"目前公司已经部署了 VLA 执行模型,并且正基于开源的 JEPA 世界模型做测试迭代。[22]

硬件·供应链

· 高通 Dragonwing Q-2390 / IQ-2390:9 月 1 日发布,本周又在 IFA 上展出,1.1 TOPS 的 IQ2 系列是高通 IoT 产品线里定位最低的一档,配四核 Kryo 加 Adreno 704;部分型号还能选装一颗 600MHz 的 SiFive E61 RISC-V 实时核,让 Zephyr 系统去跑要求亚毫秒确定性的运动控制,Arm 核则负责 AI 和连接,等于把过去需要两颗晶片才能做到的方案合并成了一颗 [23]

· 宇视机器人视觉模组:千方科技董秘在回答投资者提问时表示,宇视已经和云深处、小远机器人开展合作,配套巡检机器人的视觉模组已经在批量出货,公司给自己的定位是视觉配套服务商,并不打算自研整机,这块业务目前暂时不对外给出营收占比预期 [24],4007,4007,4007////?vt

· TI CAN XL 收发器:德州仪器表示,自己推出了行业首款商用 CAN XL 收发器,瞄准的正是机器人应用场景 [25]

文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。

FutureX · 记录未来如何发生

素材来源多方媒体/网络新闻