Files
inspiration-collector/ai-insights/daily/2026/06/14/01_宇树科技课程分析_154017.md

8.2 KiB
Raw Blame History

date, type, tags
date type tags
2026-06-14 course-analysis
机器人具身智能
宇树科技

本文共 1850 字 · 预计阅读 6 分钟

摘要课程围绕机器人具身智能的发展现状与产业实践展开杜鑫峰博士先分析了AI与机器人产业的分工逻辑与人形机器人爆发的背景进而梳理了具身智能的发展脉络与核心困难最后结合宇树科技的产品线与技术路径介绍了落地经验。笔记补充了后三节的内容力求呈现授课框架的完整性。


机器人具身智能发展与宇树科技实践

授课老师:杜鑫峰 博士(宇树科技副总经理,浙江大学客座教授)
时间2026年6月14日下午
地点:浙江大学


一、AI与机器人产业进展

业界对当前技术格局的判断趋于一致大语言模型的发展正在收敛中美在基础模型上的差距依然明显——中国在AI大模型领域短期内难以超越美国。但在机器人与具身智能的结合点上中美基本处于并驾齐驱的状态。

近两年机器人领域的融资规模急剧上升,资本和产业界普遍认为人形机器人将是终极形态:它应当兼具“能干”(执行复杂任务)、“智慧”(理解环境与指令)、“强健”(适应非结构化地形)、“灵敏”(精细操作与快速响应)四大特质。

为什么人形机器人在2024年集中爆发 核心原因在于AI大模型在语义理解、逻辑推理和任务规划上取得了突破使得机器人行业的研发分工得以重新梳理。当前主流的分工框架如下

  • 强健本体:机构设计与综合,负责机器人的机械结构、材料、关节驱动等物理基础。
  • 敏捷小脑:运动规划与控制,负责平衡、步态、力控、摔倒恢复等实时响应。
  • 智慧大脑:感知、定位与具身智能,负责理解场景、规划任务、决策交互。

其中,大脑的泛化能力是机器人进入家庭、服务场景的前提。具身智能的目标正是让通用人工智能从数字世界走向实体世界,赋予机器人主动感知与交互的能力。

具身智能研究的核心困难在于数据匮乏。与图像、文本等互联网上可获得的海量数据不同,机器人的交互数据几乎为零基础。目前有两种主流的数据获取手段:其一是让真实机器人部署在实际环境中,通过试错或示教采集交互数据;其二是借助工程化手段——利用仿真引擎自动生成大量合成场景与任务数据(例如随机生成障碍物、光照、物体摆放),从而降低对真实物理数据的依赖。


二、具身智能发展简述

具身智能并非2024年才出现的新概念。早在1950年代图灵就在论文中提出智能应当体现在与环境交互的能力上。但受限于算力、算法与传感器水平这一方向长期处于实验室探索阶段。

技术路线演变

  • 早期:基于规则的控制(如状态机、有限自动机),适用于结构化环境,但难以应对不确定性。
  • 中期基于模型的强化学习MBRL和视觉伺服利用仿真环境训练策略但仿真到现实的迁移sim-to-real始终是瓶颈。
  • 当前:大规模多模态模型(如视觉-语言-动作模型VLA与模仿学习结合借助人类示教或远程操作收集高质量轨迹数据直接训练端到端策略。

代表性方法RT-1/RT-2Google、Octo多机构联合、π0联邦学习框架等通用操控模型Unitree的强化学习控制器在四足机器人上的成功应用也说明数据驱动的运动控制已能超越传统模型预测控制MPC的性能。

主要挑战:除了数据不足,还存在泛化性弱、鲁棒性差、实时性要求高等问题。目前具身智能多在受控环境中表现良好,但离“走进千家万户”仍有距离。行业共识是:需要更高效的学习算法(如基于世界模型的想象能力)以及更便宜、更标准化的硬件平台。


三、宇树具身智能实践

宇树科技的产品线覆盖四足机器人Go1、Go2、B2、Aliengo和人形机器人H1、G1。公司最早在2021年公开零售高性能四足机器人也是全球首家将四足机器狗从实验室推向消费级的厂商。

技术路线宇树的机器人本体以高强度材料、高扭矩关节和轻量化设计见长。控制层面团队开发了基于强化学习的敏捷运动控制器能够实现跑跳、上下楼梯、穿越障碍、抗扰动平衡等复杂运动并将其部署在嵌入式边缘计算平台上。感知与决策层面宇树支持激光雷达、深度相机、麦克风阵列等多传感器融合配合自研的导航与避障算法基于经验地图与原地建图结合可在无GPS环境中自主作业。

具身智能的落地场景

  • 工业巡检:在变电站、石化管道、矿山巷道中进行设备状态监测、热成像分析和气体检测。
  • 安防巡逻:配合可见光/红外相机,实现全天候巡逻与异常行为预警。
  • 科研教育提供二次开发接口支持Open Source的强化学习环境如Isaac Gym、Issac Lab高校和研究所利用宇树机器人验证新的算法。
  • 服务与娱乐Go系列作为消费级产品主打家庭陪伴、编程教育和交互体验。

关键经验杜鑫峰博士在课程中强调宇树的实践验证了“硬件标准化软件模块化”的思路。通过将运动控制、感知、操控等模块解耦使得具身智能研究可以专注在上层算法而不必每次从底层硬件开始构建。此外宇树在仿真环境如Unitree Mujoco Sim中开源了机器人模型和控制接口促进了学术社区的数据共享与算法复现。


四、未来展望

具身智能的终极目标是构建能够自主完成任意复杂任务的通用机器人。但目前仍面临以下瓶颈:

  1. 数据闭环缺失:真实世界的交互数据难以大规模获取,且标注成本极高。未来需要依赖自监督学习、多模态融合以及仿真数据的自动生成。
  2. 泛化性不足当前模型往往在训练环境内表现优秀环境稍有变化光照、物体形态、背景遮挡即失效。世界模型World Model引入物理因果推理可能是一个突破方向。
  3. 安全性与伦理:机器人进入人类生活空间,必须保证操作的可靠性、人机交互的安全性以及隐私数据的保护。行业需要建立可验证的认证标准。
  4. 成本与供应链:高扭矩关节、灵巧手、高分辨率深度相机等核心部件仍偏贵,降本需要产业链协同。

可能的演进路径

  • 短期2-3年专用场景工厂、仓储、特种巡检率先落地采用“人机协作”模式机器人完成重复性或危险性高的工作。
  • 中期3-5年家用服务机器人清洁、整理、陪伴开始渗透基于大模型的自然语言交互成为标配。
  • 长期5-10年人形机器人成为通用平台通过软件更新即可扩展能力类似智能手机之于应用。

杜鑫峰博士认为,宇树将继续坚持“足式机器人”与“灵巧操作”双轮驱动,在硬件上降低成本、提高可靠性,在软件上拥抱开放生态,推动具身智能从实验室走进真实世界。


延伸思考

课程的核心信息在于“分工”与“数据”。当前大模型开源生态日趋丰富但机器人行业的独特瓶颈在于数据获取的高成本与低标准性。宇树的做法开放仿真环境提供标准化硬件接口本质上是试图降低研究者进入的门槛形成数据飞轮。但值得追问的是仿真数据与真实数据之间的“现实差距”能否通过算法域随机化、GAN完全弥补此外人形机器人是否是唯一的终极形态对于某些任务如管道探测、水下作业非人形蛇形、四足可能更高效通用性本身不一定依赖于人形。课程并未深入讨论这部分但可能是未来产业需要细化的问题。