
具身智能训练场报告出炉:人形机器人缺的不只是算力,还有「干净」的声学数据
2026 年 8 月 18 日,中国信通院人工智能研究所联合人形机器人(上海)有限公司、具身智能测试实验室,共同发布了《具身智能训练场研究报告(2026 年)》。
这是继 8 月 13 日《人形机器人试验方法》系列国家标准启动之后,又一份让人形机器人赛道「冷静下来」的文件。
如果说国标解决的是「机器人造出来之后,怎么测、怎么判、怎么验」的问题;那么这份训练场报告,指向的是一个更早、也更深的问题——机器人还没造好之前,靠什么「喂」大它?
报告的结论很直白:训练场产业链已初步成型,但整体呈「上游技术供给活跃、下游应用仍待拓展」的倒三角特征;训练场是重资产投入,建设成本涵盖场景建设、数采及本体设备、算力、网络、存储与管理系统;当前商业服务以数据产品出售为主,回本周期较长。
翻译成人话就是一句话:大家都急着给机器人「建学校」,但还没想清楚「学费怎么收」。
而在这座「学校」里,有一门课被严重低估了——声学。
---
一、训练场:机器人产业的「数据工厂」
具身智能和人形机器人的训练,本质上是「数据饥渴」的。
大模型吃的是文本和图像数据,这些数据在互联网上「存量巨大、近乎免费」。但具身智能吃的是「物理世界的数据」——机器人的每一个动作、每一次抓取、每一段与环境交互的轨迹,都必须靠真实的机器人本体在真实的物理场景里「跑」出来。
文本数据可以在云端生成,物理数据只能在现场采集。这就是训练场存在的根本原因:它是把物理世界转化成训练数据的基础设施。
报告点出的「倒三角」特征很关键:上游——场景建设、数据采集设备、机器人本体、算力——供给非常活跃;下游——真正愿意为训练数据付费的模型和本体厂商——还在观望。
为什么下游观望?因为现在市面上能买到的训练数据,很多「不干净、不标准、不可复现」。尤其是听觉数据。
---
二、声学数据:具身智能最被低估的「燃料」
具身智能的多模态感知,通常被拆成「视觉、触觉、力觉、听觉」四条线。视觉和触觉这两年进展飞快,唯独听觉,一直是最安静、也最被忽视的一条线。
但真实世界里,听觉恰恰是机器人「落地」最离不开的一门课:
- **听懂指令**:在车间、家庭、户外的不同噪声背景下,语音唤醒与识别是否鲁棒;
- **定位声源**:4 到 8 个麦克风阵列,能不能判断「谁在说话、从哪个方向说」;
- **感知环境**:通过环境声判断场景——是安静会议室、嘈杂车间,还是高速马路;
- **忍受自噪声**:在自身电机、减速器、风扇的持续噪声干扰下,语音链路是否依然可用;
- **发出声音**:合成语音、提示音、告警音,在真实声学环境中是否清晰、可理解。
这五件事,每一件都需要海量的带标注声学数据来训练和验证。
而问题在于:声学数据,是四种模态里最难「干净地」采集的一种。
---
三、为什么「干净」的声学数据,只能在声学实验室里产生
图像数据的好处是:光线差一点、背景乱一点,算法往往还能用,大不了后期增强。但声学数据不一样——声音一旦混进了噪声,就「洗」不干净了。
一段在混响严重的办公室里录的语音指令,你没法事后把混响「抠」出来;一段夹杂着空调、风扇、脚步和电机噪声的机器人自噪声样本,你没法事后分清「哪些是电机、哪些是减速器、哪些是环境」。
所以,真正可用于训练和验证的声学数据,必须在受控声学环境里采集:
- **全消声室**:本底噪声低至 3dB(A) 甚至更低,可以把机器人的电机、减速器微弱噪声「听」出来、定位出来——这是「自噪声数据库」的唯一来源;
- **可调混响听音室**:一键切换从安静会议室到嘈杂车间的多种声场——这是「复杂场景声学数据」的高效采集工具;
- **多模态声学实验室**:集成运动轨道、高低温、风洞、电磁屏蔽等多元场景,同步采集麦克风、加速度计、姿态数据——这是「声-振-控联合数据」的复合环境。
换句话说:视觉数据可以「路边捡」,声学数据只能「实验室造」。 这决定了声学数据在具身智能训练场的供给里,天然稀缺、天然昂贵、天然难以速成。
---
四、训练场的商业模式,藏着声学实验室的新角色
报告里有一句话值得反复读:当前训练场「以数据产品出售为主」,但「仅依靠数据出售难以覆盖重资产投入,回本周期较长」,亟需通过「平台化交易、增值服务拓展和『训练即服务』」构建多元收入结构。
这句话拆开,藏着声学实验室的三个新身份:
第一,声学数据产品的「生产车间」。 如果把训练场比作数据工厂,那受控声学环境就是其中一条不可替代的产线——生产的是带标注的声学数据集,可直接出售或上架交易平台。
第二,「训练即服务」的物理载体。 当训练场从「卖数据」转向「卖训练」,客户会把机器人本体送进来「驻场训练」。这时,一间能复现真实声学场景、又能实时采集声学数据的实验室,就是训练服务的核心硬件。
第三,数据质量的「计量标尺」。 平台化交易的前提是「数据可比、可溯源」。而声学数据的质量——信噪比、混响时间、本底噪声、采集设备标定——只有经过精密声学环境标定,才具备交易和复现的基础。
这三点叠加,意味着一个判断:声学实验室,正在从「测试基础设施」升级为「数据基础设施」。 它的价值不再只是「验收一台设备」,而是「生产一种稀缺资产」。
---
五、列星的位置
列星在这条「具身智能声学数据」的赛道上,卡住了一个很具体的位置。
我们交付的科大讯飞 7 间集群实验室,覆盖从麦克风阵列校准、远场语音识别到噪声鲁棒性、主观听感评价的全链路 AI 语音交互测试——这正是「语音指令数据」和「声源定位数据」的采集与验证基础设施。
我们打造的 AI 全场景多媒体实验室(国内首例全自动混响时间可调听音室),核心理念是「场景可变、数据可追溯」——同一间实验室几秒内从安静会议室切换到嘈杂车间,恰好对应训练场最需要的「多场景声学数据」采集能力。
我们的多模态声学实验室,可集成运动轨道、高低温、风洞、电磁屏蔽等多元场景——正是「声-振-控联合数据」的复合环境,与训练场的「数采 + 场景 + 本体」架构高度同构。
我们的尖劈型 / 平板型全消声室,本底噪声低至 3dB(A)——能在极安静环境下,把机器人电机与减速器的微弱噪声「听」出来、标定出来,这是「自噪声数据库」的唯一可信来源。
再加上「声学 + 电磁屏蔽」双技术路线,连机器人的 EMC 兼容数据也能一并承接。
从服务手机到服务汽车,从服务汽车到服务机器人——客户在变,但对「精密受控声学环境」的底层需求没有变。 华为、微软、三星、大疆、科大讯飞、小米汽车这些最挑剔的客户选择列星,本质是因为我们在反复回答同一个问题:如何在精密受控的声学环境里,把「听」这件事测准、测稳、测到可追溯。今天,这个问题的答案,正在延伸为——如何把「听」这件事,采成一份可交易的数据资产。
---
写在最后
人形机器人的竞赛,已经进入下半场。
上半场比的是「谁的机器人能跑能跳」,下半场比的是「谁的数据能把机器人喂得更聪明」。而在这场数据竞赛里,声学数据是最稀缺、最昂贵、也最被低估的一块拼图。
训练场的重资产投入会越来越高,但真正决定机器人「听觉上限」的,从来不是算力卡的张数,而是——你有没有一间能生产「干净」声学数据的实验室。
列星科技,声学环境测试一站式整体解决方案专业服务商。10 年深耕,400+ 声学实验室建设经验,服务华为、微软、三星、大疆、科大讯飞、小米汽车、SGS、TUV 莱茵等全球顶尖客户。从 3dB(A) 超低本底噪声全消声室到多模态声学实验室,从可变混响听音室到声学 + 电磁屏蔽融合实验室——我们为人形机器人时代的声学数据,准备好基础设施。
参考来源:IT之家 8 月 18 日《产业链已初步成型,中国信通院联合发布具身智能训练场研究报告》;界面新闻 8 月 18 日相关报道等。