触觉的天花板,比想象中更高。
作者丨高景辉
编辑丨马晓宁
每年的世界人工智能大会(WAIC),都是AI行业趋势的集中体现,无比火爆的今年更是如此。AI科技评论观察到,今年WAIC具身智能赛道出现了一个非常有意思的现象:几乎所有做灵巧手的公司,都在不约而同地强调自己的"触觉"能力。
放在两年前,触觉还没有引起行业的广泛重视,但今年不一样了。雷峰网发现,从传感器厂商到整机公司,"触觉"成了每家展台的核心关键词,甚至有人直接喊出"触觉比视觉还重要",行业明显开始“卷”了起来。
更值得玩味的是"卷"的程度。有的企业不止自研触觉传感器,还自研触觉模型,自己采触觉数据,甚至连最底层的触觉芯片都要自己做。一家做传感器的公司把手伸到了芯片和算法领域,这在传统硬件行业是相当少见的。
那么问题来了:为什么大家突然开始卷触觉?这么大力度的投入真的有必要吗?
01
机器人的触觉,需要"专属"的模型
触觉之于灵巧操作的重要性,行业其实早有共识。随着具身智能从demo走向真实场景落地,纯视觉灵巧操作方案的天花板越来越明显,毕竟摄像头有盲区,感知不到手指和物体之间的细微接触,就像视力再好的人戴着手套做针线活,看得见线头,却感觉不到针有没有穿过去。
于是,过去一两年,整个行业都在做同一件事:把触觉模态"加"进现有的VLA模型里。听起来顺理成章,多一个感知维度,模型能力总该更强吧?
但最近一篇名为“T-Rex”的论文,给出了一个反直觉的答案:直接把触觉硬塞进模型,效果反而更差。
这篇论文的阵容堪称"神仙级别"——李飞飞、NVIDIA的Jim Fan、UC Berkeley的Trevor Darrell、Pieter Abbeel……几乎集齐了全球AI与机器人领域最顶尖的研究者。他们做了一个最直观的实验:给行业经典模型 π0.5加上触觉条件后,任务成功率从17%直接跌到了6%。
为什么会这样?因为机器人的模型能力,不能靠堆叠模态来提升。
触觉信号和视觉信号本质上是两种完全不同的信息。视觉是低频的、全局的,5Hz就能完成一次场景理解;触觉是高频的、局部的,需要20Hz甚至更高频率才能捕捉到滑移、形变这些细微变化。把两个频率、逻辑都不一样的信号硬塞进同一个处理通路,只会互相干扰,就像让GPS导航和方向盘微调共用一个芯片,两个系统抢方向盘,车反而开不稳。
更重要的是,T-Rex验证了一个判断:触觉不是视觉的附带品,它需要自己的时序编码、自己的处理通路、自己的训练范式。
这也解释了为什么一些触觉传感器头部企业,比如他山科技等,要投入资源做"原生触觉模型"。想要触觉真正参与控制闭环,就必须有专门适配触觉特性的模型架构。这不算一种“卷”,更不是重复造轮子,而是从实际需求出发,解决行业的“真问题”。
02
芯片是底层基建,从什么时候开始做都不算早
如果说"做专属触觉模型"还能形成小范围行业共识,那么"自研触觉芯片"面临的争议就要大得多。
有不少从业者提出质疑,当前触觉传感器的技术路线都还没完全收敛,量产规模也不算高,落地场景更不够稳定,现在就自研芯片,是不是太早了?投入产出比算得过来吗?
这个疑问不能说没有道理。芯片研发的周期长、投入大、风险高,通常是行业进入成熟期、需求量足够大之后才会做的事。一家创业公司提前几年布局芯片,怎么看都像是一场豪赌。
但换一个角度,从第一性原理思考,结论可能完全不同。
机器人的终极形态是拟人化的。而拟人化的技术方向,必然朝着低功耗、低延时、核心指标持续升级的路径演进。这些底层诉求,最终都要靠芯片来承载。
还有一个更现实的问题是,现有的通用芯片,根本满足不了机器人触觉的落地需求。
触觉感知不止有模拟信号采集这一层。要完成一次完整的触觉反馈,需要模拟前端、端侧小算力MCU、电源驱动、信号路由等一系列芯片协同工作。指尖传感器的触点密集、体积极小,对集成度的要求非常高,单颗高度集成的专用芯片,远比多颗分立芯片的方案更优。
很多中国的传感器公司一开始也用海外大厂的芯片,但很快发现两个问题:一是单一芯片支撑不了完整的触觉技术栈,二是通用芯片的参数不是为触觉场景优化的,测量频率、通道数配比、弱信号感知能力,都有明显短板。
但自研芯片带来的提升是实打实的。2021年他山科技发布全球首款AI触感专用芯片“红宝石”。今年WAIC上他山科技最新发布的“绿宝石”E10A芯片,更是能将触觉感知信号直接在硬件层面转为脉冲信号。在此之前,脉冲转换需要先把模拟转成数字,再通过软件转脉冲;现在直接硬件完成,效率和延迟都上了一个台阶。
测量频率上的提升更明显。行业普遍的单传感器测量频率在几十赫兹量级,而他山的新款芯片沿用原有模式频率就能提升2-3倍,切换到脉冲输出模式更是提升100倍,有了如此高的频率,就能捕捉指尖更精细的变化。
更深一层看,芯片研发有自己的时间周期和技术沉淀规律,不能等产品快要大规模落地了才开始做芯片,那样至少会落后两到三年。从这个意义上说,早布局也是为未来的落地窗口提前铺路。
当然,不是每家公司都有能力、有必要自研芯片。这需要深厚的模拟芯片设计积累、足够的量产经验支撑,以及对触觉场景的深度理解。但对于头部企业而言,芯片作为底层基建,从什么时候开始做都不算早。
03
自研数采设备,可能只是一种"水到渠成"
与“自己做芯片”不同,"自己采数据"这件事,行业基本已经形成了共识。因为具身数据这个赛道,商业化供应链还很不成熟,第三方数据供应商的产品很容易同质化。大家都用差不多的采集方案、差不多的任务场景,训练出来的模型自然也拉不开差距。想要建立数据壁垒,最终还是得自己采。
但更值得讨论的问题是:为什么连数据采集设备本身,也需要自研?
市面上不是没有现成的方案。外骨骼、数据手套……这些构型都存在很多年了。但真正用到触觉数据采集上,问题就暴露出来了。
最常见的柔性触觉手套,大多基于压阻方案。这种方案有一个致命缺陷:数据一致性太差。柔性基底加柔性传感器的组合,误差会被层层放大,弯折过程中即使没有受力,也会产生数据跳变,还存在数据残留、漂移等问题。行业对柔性手套的触觉数据容错率原本放宽到30%-40%的无效数据,但实际使用中,大部分数据都是无效的。
外骨骼方案倒是能保证关节位置数据的精度,但它体积大、成本高、佩戴复杂,很难规模化推广。而且外骨骼主要采集的是关节角度,触觉信号本身还得另想办法。
于是,一些擅长做“触觉”的公司开始尝试新的构型。比如今年WAIC上,他山科技就推出了一种指套式的采集方案,戴在指尖上即可,因为指尖是实现抓取等功能的核心部位,优先级远高于指肚、指腹、手掌,先把最关键的数据做好;另外,指套不会遮挡手部关节,可以同时用摄像头捕捉关节运动数据,不需要额外通过外骨骼或IMU采集,也能保持高一致性。
不过,也不用把自研数采设备上升到"战略布局"的高度,它更像是一种"水到渠成"的结果。
他山科技已经有了自研芯片、有了成熟的传感器硬件、有了上百家客户的量产经验,再做数采设备的门槛其实已经很低了。芯片是自己的,传感器是自己的,客户需要什么样的数据最清楚,无非是把这些能力重新组合成一个新产品。
更何况,作为一种产品,数采设备的核心无非是解决用户的痛点,而他山在解决“测量一致性”这一数采最大痛点上,本就领先了行业一个数量级。他山的传感器多次测量标准差≤0.03,确保每次采集均获得高度一致的数据输出;同时线性拟合优度R²≥99.9%,能够真实反映受力变化。即使是“水到渠成”,其“水质”也是越高越好。
除此之外,“数采自研”这件事对整个行业都有益。数据采集的门槛降下来,更多团队才能投入到触觉模型的研发中,整个生态才能转起来。从这个意义上说,头部企业自研数采设备,其实是在做大蛋糕。
04
触觉的天花板,比想象中更高
把视角再拉高一层,"卷"触觉这件事,可能本身就是必要的。因为触觉的价值,可能远比我们现在想象的要大。它不只是"让灵巧手操作更精细"这么简单,还可能是打开物理AI下一扇门的钥匙。
今年WAIC上,图灵奖得主Richard Sutton在演讲中提到一个核心观点:未来的AI,应该"在自己的生命过程中不断学习"。
这句话翻译成机器人领域的语言,其实就是真机强化学习,即让机器人像人一样,在真实世界里通过试错自主成长,而不是完全依赖人类标注的数据。
这个方向听起来很美好,但为什么过去一直没能跑通?
成本当然是一个原因。真机太贵了,摔坏一台心疼半天,谁敢让它随便试错?
但还有一个更深层的原因,那就是如果没有触觉,真机强化学习根本无从谈起。
想想人类的成长逻辑。婴儿时期,如果只能保留一种感知,首选一定是触觉。因为触觉是最基础的安全反馈机制,比如碰到烫的会缩手,抓不住的东西会掉落,用力太大会疼。没有触觉,婴儿根本无法安全地与世界、物体、人交互。
机器人也是一样。纯视觉的机器人,"看"得到物体,但不知道自己用了多大劲、有没有抓稳、会不会捏坏。让这样的机器人去自主试错,要么把东西全弄坏,要么自己摔得稀碎,强化学习的"奖励函数"根本无从建立。
触觉提供的,恰恰是最直接的物理反馈。只有能感知到伤害,才能学会避免伤害;只有能感知到接触状态,才能学会调整力度。这正是真机强化学习最需要的闭环信号。
这也是为什么Richard Sutton会和他山科技合作,共同建立"机器人幼儿园"项目。双方想验证的,就是一套基于触觉的AI自训练、自学习新范式,让机器人像孩子一样,从触觉出发,在真实交互中逐步成长。
7月18日,Richard Sutton来到他山科技的WAIC展台,现场分享了“机器人幼儿园”理念。他提到:“我们不只希望机器人用手指获得触觉,我们希望能让机器人的全身都具备触觉能力。为了强化学习的目标——能够通过试错算法持续改进。并且让机器人拥有足够‘强壮’的硬件,能够不断试错、摔倒了再爬起来,这一点特别关键。”
Sutton表示,他山是触觉感知领域的领导者,在触觉感知在探索和从经验中学习方面非常出色,同时他山对于“从经验中学习”这个理念的共鸣,以及他们根本上对科学探索和开放的态度,让Sutton选择了他们。
雷峰网认为,未来这个方向如果跑通,意义将远超"灵巧手更灵活"这件事本身。它意味着机器人的学习方式可能发生根本变化:从"人类教什么会什么",变成"自己探索、自己学习、自己成长"。
当然,这条路还很长,现在的触觉距离人类那种分布式的、全手的、多模态的触觉感知还差得远。T-Rex论文自己也承认,缺少手掌触觉、缺少温度感知,这些都是未来需要补的课。
但方向已经越来越清晰了。
从T-Rex验证"触觉需要专属模型架构",到企业自研芯片筑牢底层基建,再到数采设备降低数据门槛,最后到真机强化学习探索终极范式,整个行业正在从不同层面,共同把触觉的天花板往上推。
回过头看,WAIC上的“卷触觉”更像是一个信号:具身智能的竞争,已经从"有没有"进入了"好不好"的阶段。视觉的红利吃得差不多了,下一个突破口,大概率就在触觉。
触觉这条赛道,远比表面看起来更深。那些愿意沉下心做底层技术的公司,可能会在未来某个节点,突然爆发出惊人的势能。