8.2 KiB
date, type, tags
| date | type | tags | ||
|---|---|---|---|---|
| 2026-06-14 | course-analysis |
|
本文共 1850 字 · 预计阅读 6 分钟
摘要:课程围绕机器人具身智能的发展现状与产业实践展开,杜鑫峰博士先分析了AI与机器人产业的分工逻辑与人形机器人爆发的背景,进而梳理了具身智能的发展脉络与核心困难,最后结合宇树科技的产品线与技术路径介绍了落地经验。笔记补充了后三节的内容,力求呈现授课框架的完整性。
机器人具身智能发展与宇树科技实践
授课老师:杜鑫峰 博士(宇树科技副总经理,浙江大学客座教授)
时间:2026年6月14日下午
地点:浙江大学
一、AI与机器人产业进展
业界对当前技术格局的判断趋于一致:大语言模型的发展正在收敛,中美在基础模型上的差距依然明显——中国在AI大模型领域短期内难以超越美国。但在机器人与具身智能的结合点上,中美基本处于并驾齐驱的状态。
近两年机器人领域的融资规模急剧上升,资本和产业界普遍认为人形机器人将是终极形态:它应当兼具“能干”(执行复杂任务)、“智慧”(理解环境与指令)、“强健”(适应非结构化地形)、“灵敏”(精细操作与快速响应)四大特质。
为什么人形机器人在2024年集中爆发? 核心原因在于AI大模型在语义理解、逻辑推理和任务规划上取得了突破,使得机器人行业的研发分工得以重新梳理。当前主流的分工框架如下:
- 强健本体:机构设计与综合,负责机器人的机械结构、材料、关节驱动等物理基础。
- 敏捷小脑:运动规划与控制,负责平衡、步态、力控、摔倒恢复等实时响应。
- 智慧大脑:感知、定位与具身智能,负责理解场景、规划任务、决策交互。
其中,大脑的泛化能力是机器人进入家庭、服务场景的前提。具身智能的目标正是让通用人工智能从数字世界走向实体世界,赋予机器人主动感知与交互的能力。
具身智能研究的核心困难在于数据匮乏。与图像、文本等互联网上可获得的海量数据不同,机器人的交互数据几乎为零基础。目前有两种主流的数据获取手段:其一是让真实机器人部署在实际环境中,通过试错或示教采集交互数据;其二是借助工程化手段——利用仿真引擎自动生成大量合成场景与任务数据(例如随机生成障碍物、光照、物体摆放),从而降低对真实物理数据的依赖。
二、具身智能发展简述
具身智能并非2024年才出现的新概念。早在1950年代,图灵就在论文中提出智能应当体现在与环境交互的能力上。但受限于算力、算法与传感器水平,这一方向长期处于实验室探索阶段。
技术路线演变:
- 早期:基于规则的控制(如状态机、有限自动机),适用于结构化环境,但难以应对不确定性。
- 中期:基于模型的强化学习(MBRL)和视觉伺服,利用仿真环境训练策略,但仿真到现实的迁移(sim-to-real)始终是瓶颈。
- 当前:大规模多模态模型(如视觉-语言-动作模型,VLA)与模仿学习结合,借助人类示教或远程操作收集高质量轨迹数据,直接训练端到端策略。
代表性方法:RT-1/RT-2(Google)、Octo(多机构联合)、π0(联邦学习框架)等通用操控模型;Unitree的强化学习控制器在四足机器人上的成功应用也说明,数据驱动的运动控制已能超越传统模型预测控制(MPC)的性能。
主要挑战:除了数据不足,还存在泛化性弱、鲁棒性差、实时性要求高等问题。目前具身智能多在受控环境中表现良好,但离“走进千家万户”仍有距离。行业共识是:需要更高效的学习算法(如基于世界模型的想象能力)以及更便宜、更标准化的硬件平台。
三、宇树具身智能实践
宇树科技的产品线覆盖四足机器人(Go1、Go2、B2、Aliengo)和人形机器人(H1、G1)。公司最早在2021年公开零售高性能四足机器人,也是全球首家将四足机器狗从实验室推向消费级的厂商。
技术路线:宇树的机器人本体以高强度材料、高扭矩关节和轻量化设计见长。控制层面,团队开发了基于强化学习的敏捷运动控制器,能够实现跑跳、上下楼梯、穿越障碍、抗扰动平衡等复杂运动,并将其部署在嵌入式边缘计算平台上。感知与决策层面,宇树支持激光雷达、深度相机、麦克风阵列等多传感器融合,配合自研的导航与避障算法(基于经验地图与原地建图结合),可在无GPS环境中自主作业。
具身智能的落地场景:
- 工业巡检:在变电站、石化管道、矿山巷道中进行设备状态监测、热成像分析和气体检测。
- 安防巡逻:配合可见光/红外相机,实现全天候巡逻与异常行为预警。
- 科研教育:提供二次开发接口,支持Open Source的强化学习环境(如Isaac Gym、Issac Lab),高校和研究所利用宇树机器人验证新的算法。
- 服务与娱乐:Go系列作为消费级产品,主打家庭陪伴、编程教育和交互体验。
关键经验:杜鑫峰博士在课程中强调,宇树的实践验证了“硬件标准化,软件模块化”的思路。通过将运动控制、感知、操控等模块解耦,使得具身智能研究可以专注在上层算法,而不必每次从底层硬件开始构建。此外,宇树在仿真环境(如Unitree Mujoco Sim)中开源了机器人模型和控制接口,促进了学术社区的数据共享与算法复现。
四、未来展望
具身智能的终极目标是构建能够自主完成任意复杂任务的通用机器人。但目前仍面临以下瓶颈:
- 数据闭环缺失:真实世界的交互数据难以大规模获取,且标注成本极高。未来需要依赖自监督学习、多模态融合以及仿真数据的自动生成。
- 泛化性不足:当前模型往往在训练环境内表现优秀,环境稍有变化(光照、物体形态、背景遮挡)即失效。世界模型(World Model)引入物理因果推理可能是一个突破方向。
- 安全性与伦理:机器人进入人类生活空间,必须保证操作的可靠性、人机交互的安全性以及隐私数据的保护。行业需要建立可验证的认证标准。
- 成本与供应链:高扭矩关节、灵巧手、高分辨率深度相机等核心部件仍偏贵,降本需要产业链协同。
可能的演进路径:
- 短期(2-3年):专用场景(工厂、仓储、特种巡检)率先落地,采用“人机协作”模式,机器人完成重复性或危险性高的工作。
- 中期(3-5年):家用服务机器人(清洁、整理、陪伴)开始渗透,基于大模型的自然语言交互成为标配。
- 长期(5-10年):人形机器人成为通用平台,通过软件更新即可扩展能力,类似智能手机之于应用。
杜鑫峰博士认为,宇树将继续坚持“足式机器人”与“灵巧操作”双轮驱动,在硬件上降低成本、提高可靠性,在软件上拥抱开放生态,推动具身智能从实验室走进真实世界。
延伸思考
课程的核心信息在于“分工”与“数据”。当前大模型开源生态日趋丰富,但机器人行业的独特瓶颈在于数据获取的高成本与低标准性。宇树的做法(开放仿真环境,提供标准化硬件接口)本质上是试图降低研究者进入的门槛,形成数据飞轮。但值得追问的是:仿真数据与真实数据之间的“现实差距”能否通过算法(域随机化、GAN)完全弥补?此外,人形机器人是否是唯一的终极形态?对于某些任务(如管道探测、水下作业),非人形(蛇形、四足)可能更高效,通用性本身不一定依赖于人形。课程并未深入讨论这部分,但可能是未来产业需要细化的问题。