李智强:未来补足大模型的短板,要通过触觉
“2025世界大会”于8月8日至12日在北京经济技术开发区开幕。“AI 大模型赋能机器人与具身智能产业新范式交流活动”作为2025世界机器人大会的专题活动于8月8日同期召开。深圳一目科技有限公司创始人兼CEO李智强出席并演讲。

以下为演讲实录:
大家好!我今天给大家带来的题目是“触觉增强的世界模型”。
今天看到很多在具身智能发展还是非常疯狂的,作为一个AI科技老兵看到这些发展也是非常期待,我2011年从CMU毕业,当时AI还在发展的初期,带大家回顾一下AI发展的早期,从2000年初开始有了ImageNet,然后逐渐催生了视觉智能向前发展。那时候非常不够先进,从2010年开始尝试识别视觉里的各种物体。到了今天过去15年已经发展到了OpenAI的ChatGPT这种多模态模型完全能够进行语义的理解以及重建。我们已经走到了今天纯视觉重建的过程。
我觉得具身智能的未来应该是过去15年视觉智能过去发展历史的起点,未来其实还有一些缺失的部分,我们到底应该做哪些事情来补足这些,来推动人工智能在具身智能方向发展。我们看到了这样一些缺失点。比如说我们对于整个世界物理模型的一些参数还是有缺失的,其实有很多在VLA模型跑的非常先进了,我觉得也是非常好的开始。
比如说对于一些材质、物理结构更高维度的参数还是缺失的,如果想构建这样一个世界大模型的话,其实还是要补足这样一个过程的,因此我们认为靠什么来补足还不能获取的数据。可以参考过去的发展,通过camera的演进,通过视觉模型的演进获得更好的视觉辨认能力和语义理解能力以及对于听觉的理解能力。
未来在更多的维度对于物体的理解上需要补足触觉的理解力的。特别有意思的一点,触觉的感知和执行其实是一个物体,都是我们的手。这个跟视觉和听觉不太一样的地方,视觉和听觉对于非接触性的物体的感知非常好,但一旦有了接触,我们的执行器和感知器是完全统一的,这也是它最美妙的地方之一。
因此我们觉得未来补足大模型的短板,是要通过触觉。能不能通过触觉来增强VLA模型?真正的推动具身智能的发展。
具体怎么做?我们想做一个思想实验,每个人可以尝试一下从口袋里摸一下物体,人是可以非常轻松的辨别出口袋里到底是一把钥匙还是一个耳机,还是一枚硬币。这个过程怎么做到的,不是一个非常严谨的推理和计算的逻辑,其实是人对这个物质和世界逐渐的触碰、探索、3D构建以及物理世界映射的关系。我可以很容易的知道这把是钥匙,这个是耳机,我认为其实机器人也应该能够重构人对于物理世界感知的能力。
如果有一天机器人能够不停的通过触碰,通过探索来重建类人的感知能力,那我觉得才是世界模型到达终极目标的那天。具体怎么做到?我们也不是先行者,我们应该从PIXELS到VOXELS,我们从一个真实的物理世界通过数字化的PIXELS化获得更多维度的触觉感知的信息,最终通过物理世界的三维构建形成VOXELS信息,导入到我们的物理大模型里面去,然后形成更多维度的感知。
如果想实现这件事情,这样的触觉感知系统需要满足三个条件。
第一个条件,一定是绝对类人的感知能力,而且是始于所有的对于类人触觉能力的反算,要基于从原理上、从架构上、性能上、形态上要有绝对的类人性。
第二个条件,在系统工程的优化能力上要做到高保真的鲁棒系统。我们看视觉和听觉的演进,都是从最早的低像素、低分辨率到逐渐类人化的演进。我们认为触觉也应该有相似的过程,逐渐逼近人类的触觉能力,所以应该从空间一致性、时序稳定性、信号完整性以及生物贴合性完全类人。
第三个条件,既然要成为具身智能,一定要跟具身的大模型打通,必须形成一种高效鲁棒的算法体系,能够从端到端结合大现有的VLA或者VTLA模型里面去,能够形成类人的感知能力。
这三点都是需要满足的才是最终极的触觉感知能力。
我们也不是这个世界上第一个提出的,我们也致敬前辈,视触觉和光触觉的方案应该是目前看到的最好的一类触觉解决方案,一目也发布了视触觉的解决方案,在它的高保真、高像素以及鲁棒性分析做到了最优化。
我们可以像人一样通过反复的触碰这个物理世界演进,然后重构对于物理世界三维坐标体系以及三维形态的理解,形成更多维度的能力体现,最终输入到大模型里进行具身智能的演进。这是第一个问题就是硬件问题,能够通过触觉传感器来解决。
具身智能在Locomotion、Navigation方面已经做的非常好了,但在Manipulation尤其是精细化操作方面还是有欠缺的,这个欠缺主要还是在数据上的欠缺。数据集是我们最缺乏的东西,我们怎么去解决第二个问题就是数据问题,一目也想通过触觉传感器以及触觉解决方案能够加速海量的高质量数据的收集这样一个过程。如何去做?我们也比较相信英伟达提出的逻辑。如果仅仅靠人力来收集数据的话永远是线性的,永远不可能像OpenAI,像ChatGPT一样赶上海量的数据,这个线性的路径完全不能让我们走向具身智能终点的,我们的想法是一定要用现实作为锚点,通过仿真作为数据放大的过程,放大10倍、100倍甚至1000倍的能力来加速整个的采集。但这里有一点,一定是有真实数据作为你的锚点去增加你的数据量。
这样的话才能赶上具身智能数据的需求。如果具身智能没有海量数据,其实很难推动它的发展。我们做了很多尝试和实验,在物理模型里通过英伟达的物理模型先去尝试触碰了世界上上百万种物体,比如说有胶水、螺丝刀和各种钢笔等等,已经在仿真世界通过不同的环境、不同的光照、不同的物理形态做过了这样的模拟和触碰。很快就可以把这样的算法迭代到实际应用当中去了。
这段时间就是先通过仿真获得基础模型,然后在现实中对这个模型做一些现实真实数据的恢复。最终可能通过一两次的抓握,就能够完全重构原来需要做很多次尝试的场景。比如已经可以辨认各种各样的物体,甚至对于物体的位姿和形态进行判断。
另外这个过程中鲁棒性要有实时的校准,如果对它进行干扰,也能够重新回到最正式的姿势中去。我们不仅仅关注成功案例,也会关注失败案例,比如说做一些易碎东西的夹取,人都是通过很多次的尝试去学习。我们知道那些失败的案例,也知道成功的案例,才能更快的达到最稳定的状态。
因此我觉得通过硬件能力以及对于算法和数据的加成的发展,才能进入到一个快车道,最终如何满足用户的需求,如何提供这些服务,英伟达提出了一套通用机器人的架构,我们非常认同。这套架构未来应该是更容易接入的,通过对于原始材料的调度和处理,可以调用不同的physical intelligence的engine,最终给用户交付的是我们的文明、我们的结果、我们的用户价值。通过这样的通用架构来实现通用价值的落地。
通用性到底是如何完成的,到底有多么的通用,我们分析了一下,世界上80%都是通用case,但是会发现人也很不一样,比如说专业运动员,专业的手术大夫,他们的手其实跟人是不一样的,他们的intelligence也是更专业化的,所以我们提出必须能够从等体与软件上共同来打通这样一个解决方案。
日常任务可以分为下肢强度型以及上肢精度型。我们主要关注的是精细化的操作,偏上肢的运动能力,也会发现也符合二八原则。80%的日常任务,可以通过较为通用的模块来实现。还有20%的特殊任务可以提供更专业化的更多的训练案例来解决。为大家提供了manipulation as a service,我们认为精细化即服务这是一项更好的实现路径,通过服务包括硬件、软件、算法能够为所有需要做精细化操作的场景提供通用服务。今年年底会带来这样的服务,敬请大家期待。
最后介绍一下我们公司,我们一目科技,2015年成立于美国的硅谷。我们这个名字的来源其实有点意思,在五亿两千五百万年前,其实是三叶虫发展出了第一个能够感光的眼睛,带来了整个生物的大爆发,带来了所有智能生物的发展,我们一目就相信自己希望成为那个人工智能里的第一只眼,能够推动整个人工智能向未来具身智能向更高更快的Scaling law发展,而做出自己的贡献,希望跟大家进行一个合作。
谢谢大家!
新浪声明:所有会议实录均为现场速记整理,未经演讲者审阅,新浪网登载此文出于传递更多信息之目的,并不意味着赞同其观点或证实其描述。
- • 比亚迪李云飞再回应“车圈恒大”:某河北车企煽动舆论,经查没有问题
- • 2021款奥迪A3售价解析:品质与性价比的完美结合
- • 深康佳A一季度业绩明增实亏,华润入主后能否破局?
- • 《战地4官网下载:重温经典战场的激情与荣耀》
- • 新能源、创新药等赛道展现超强实力,中国科技创新加速“突围”
- • CPI与核心CPI走势能否趋同仍存不确定性|宏观晚6点
- • 大爆发!一字涨停,“20cm”7连板!
- • 华晨宇整容传闻:真相还是谣言?
- • 养老机器人要来了,两部门发文推进试点工作
- • 有行情,买券商!沪指迭创年内新高,顶流券商ETF(512000)单日获资金爆买超1.6亿元!
- • 西部水泥:助力中国西部建设的绿色先锋
- • 小米11深度测评:性能卓越,拍照出众,性价比之选
- • 依法依规治理企业无序竞争、推进重点行业产能治理,政治局会议重磅发声
- • 探索“hong20”背后的故事:一场跨越时空的对话
- • 快舟十一号:中国航天事业的又一里程碑
- • 黄河实业公布年度业绩 拥有人应占溢利1052.4万港元同比减少50.18%
- • 陕西天然气集团:推动能源转型,助力绿色发展
- • 泰国拟向美国做出更多贸易让步 以避免 36% 的关税
- • 上海去年PM2.5年均浓度28微克/立方米,近岸海域水质有所改善
- • 特朗普回应马斯克道歉:我认为他这样做非常好
- • 邮件的正确格式:职场沟通的得力助手
- • Coinbase自曝数据泄露并遭黑客勒索,损失或高达4亿美元
- • 笔记本键盘怎么清理:轻松解决键盘污渍与灰尘困扰
- • 深入了解EMS价格:如何选择合适的快递服务
- • 田教授家的盛大聚会:二十八个亲戚的温馨故事
- • 书写开放包容、合作共赢新篇章——2025夏季达沃斯论坛观察
- • 王侠:无底线的价格战对企业、消费者都是不利的
- • 探索qquj音乐:独特魅力与多元风格的音乐之旅
- • 小海鸥贝壳粉:环保建材新宠,绿色家居新选择
- • 文明校园创建问卷调查:助力校园文化建设,共筑和谐美好校园
- • 《你懂的电影:光影交织中的情感共鸣》
- • 2015年1月23日:历史长河中的一颗璀璨星辰
- • 美联储不降息后特朗普“暴怒”!痛斥鲍威尔“太蠢、太政治化”
- • 商务部召开外贸企业圆桌会:全力为外贸企业纾困解难,提供更多支持
- • 《坎贝奇三部曲之第一部:探寻历史的奥秘——揭秘《坎贝奇:失落的帝国》》
- • 美国有多少个州和特区:探索美利坚合众国的地理版图
- • 学子宴上的温馨致辞:感恩成长,展望未来
- • 周一围女助理:才华横溢的幕后英雄
- • 利润骤降70%!传音控股,被小米们送进“非洲ICU”|BUG
- • 美债收益率曲线大幅陡化 据悉特朗普询问是否应解雇鲍威尔
- • 财政部:7月10日至7月19日将发行不超过450亿元两期电子式储蓄国债
- • 精液的气味:揭秘男性生殖健康的密码
- • 秉持开放互鉴与合作交流,《全球中国》出版
- • 交易员加码对冲美联储降息路径剧变风险 市场预期亦出现分化
- • 西布曲明:揭秘为何这种减肥药被禁
- • “去哪儿网人工客服电话:您的旅行助手,随时待命”
- • 揭秘EMS价格:了解物流运输成本背后的秘密
- • 揭开越南雏妓现象的神秘面纱:细节揭示背后的残酷现实
- • 最高2055美元,又一家车企宣布要在美国涨价
- • 杭州临平区两宗地块底价成交,5月土拍共计收金约93亿元
- • 2025上海十大动漫IP评选,大众投票开启
- • 网易云音乐早盘涨超7%再创新高 年内股价累计涨超1.1倍
- • 财政支出成为投资者最大担忧 日本引领全球长期国债下跌
- • 《王者荣耀:揭秘刷点卷技巧,轻松提升战斗力!》
- • 网络时代下的“邪恶图片”:警惕与反思
- • 西安临潼公布上半年财政收支,新收入分成体系致区级分成减少
- • 七国集团引发新一轮外汇政策关注 美元跌至一个月低点
- • 希尔顿家族:奢华酒店的传奇缔造者
- • 西迁精神的核心:传承与创新的精神力量
- • “萌宠来袭:揭秘宠物刺猬的独特魅力”
- • 日本6月出口同比下降0.5%,对美出口连续两月大幅下滑
- • 刺猬的拥抱:温暖与孤独的交织
- • 印尼巴厘岛倾覆快艇上有80人,2名中国公民遇难
- • 欧洲央行副行长:将“相对较快地”实现2%的通胀目标
- • 耶路撒冷发生山火以防长宣布紧急状态
- • 美国经济萎缩意味着什么?关税政策如何反噬经济?
- • 港股,重磅调整!明天正式实施!
- • 揭秘“EvilAngel”肛门特技:一场关于勇气与挑战的视觉盛宴
- • 美以领导人就加沙教堂遭袭通话,以总理发声明称“误击”
- • 全运会历史首次走进港澳,人脸识别、前置查验实现“跨境无感通关”
- • 就业结构性矛盾仍然突出,统计局:要更大力度稳定和扩大就业
- • 浑南人才网:助力沈阳人才发展的新引擎
- • 小鹏汽车与华为合作研发抬头显示技术,将首先搭载于G7车型
- • 美元困境反成利好 多家跨国企业一季度财报喜获提振
- • “架连心桥”“推无形墙”,理论传播如何走出新路径?
- • 俄官员:美国恢复向乌克兰供武不会改变前线局势
- • 高股息继续走强,价值ETF(510030)午后翻红!机构力挺“红利底仓”!
- • 《离不开你原唱背后的故事:一段深情演绎的传奇》
- • 吸油汤:揭秘其真伪,健康减肥的利器还是虚假宣传?
- • 新冠发烧几天:了解新冠病毒感染后的发热症状及应对措施
- • 《乐高大电影2》高清下载攻略:重温欢乐,开启奇幻冒险之旅
- • 加拿大鹅股价飙升27% 业绩超预期但撤回全年指引
- • 王毅会见俄罗斯外长拉夫罗夫
- • 上海原创舞剧《白蛇》在纽约首演,还走进了CBS直播间
本文 快租网 原创,转载保留链接!网址:https://kuaizu.me/post/25304.html