course: 宇树科技杜博士课程分析 154017

This commit is contained in:
Beast
2026-06-14 15:40:49 +08:00
parent 01ae0fcbe8
commit 71df83020f
2 changed files with 90 additions and 128 deletions

View File

@ -1,128 +0,0 @@
# 机器人具身智能发展与宇树科技实践
授课老师:杜鑫峰 博士(宇树科技副总经理)
时间2026年6月14日下午
地点:浙江大学
杜鑫峰博士曾任浙江国自机器人技术股份有限公司副总裁现担任浙江大学客座教授兼控制学院创业导师深耕机器人研发与产业推广数十年是国内特种机器人与具身智能产业化的资深从业者兼具科研、管理与市场视野。宇树科技是全球最早公开零售高性能四足机器人的公司之一曾受邀参加2021年牛年央视春晚、2022冬奥会开幕式专注于消费级、行业级高性能通用足式/人形机器人及灵巧机械臂的自主研发。
---
## 1. AI与机器人产业进展
### 当前格局AI大模型与机器人赛道分化
业界普遍认为,大语言模型的演进趋势已趋向收敛——技术路径、训练方法、基础设施逐步标准化,中国在这一方向上与美国的差距较为明显,追赶难度较大。但机器人具身智能领域则呈现不同局面:中美并驾齐驱,各有优势。造成这种分野的核心原因在于,机器人涉及硬件制造、运动控制、系统集成等复杂工程链条,并非单纯算法竞赛,而中国在产业链完整性和应用落地方面具备独特优势。
近两年,机器人领域的融资规模显著增长,尤其是人形机器人方向吸引了大量资本关注。杜老师给出判断:人形机器人将是未来机器人的终极形态,其核心特征可概括为四个关键词——能干(任务执行能力)、智慧(感知与决策)、强健(硬件可靠性与耐久性)、灵敏(动态响应与协调性)。
### 人形机器人为何在2024年集中爆发
2024年成为人形机器人的爆发节点直接驱动因素是大语言模型在智能推理、自然交互方面取得突破这使得机器人行业内部形成了清晰的分工逻辑。
行业按照机器人共性关键技术划分出三条分工路线:
- **强健本体**——机构设计与综合:负责机器人的机械结构、材料选型、关节驱动等硬件基础,解决“能不能站稳、能不能负重”的问题。
- **敏捷小脑**——运动规划与控制:负责行走、抓取、避障等底层运动控制,解决“能不能走得稳、动作准”的问题。
- **智慧大脑**——感知、定位与具身智能:负责环境理解、任务规划、人机交互等高层推理,解决“能不能理解环境并自主决策”的问题。
杜老师特别强调,**大脑的泛化能力**是机器人从实验室走向千家万户的基础。过去的机器人只能完成预设的特定动作,一旦环境变化就失效,而具身智能追求的正是让机器人在开放、动态的真实世界中自主应对未知场景。
### 什么是具身智能
具身智能Embodied Intelligence的核心目标是让通用人工智能从数字世界走向实体世界。如果说传统AI停留在屏幕和数据中具身智能则要求智能体拥有物理身体能在真实环境中感知、行动和交互。这不仅是算法问题更是系统问题——它将感知、控制、规划、执行整合在一个物理实体上。
### 具身智能的核心困境:数据瓶颈
机器人学习面临的最大瓶颈是缺乏数据。与图片和文字的海量积累形成鲜明对比的是,机器人可以学习的交互数据极为匮乏。原因在于:机器人数据采集成本高,需要真实环境、物理交互、重复试验,无法像标注图片那样低成本规模化。
目前主流的数据收集路径有两条:
1. 让具身本体在真实环境中采集交互数据,通过实际试错和人类示教来积累经验
2. 用工程手段(仿真引擎、自动场景生成)取代传统人工数据收集,在虚拟环境中大规模生成训练数据
这两种方法各有局限真实数据成本高、样本少仿真数据存在与现实之间的“Sim-to-Real Gap”即模拟环境的模型偏差会导致学到的策略在真实世界中失效。
---
## 2. 具身智能发展简述
### 从机械执行到智能涌现
具身智能并非全新概念其思想可追溯至20世纪中期的控制论和1950年代图灵对智能体与物理世界交互的探讨。但真正意义上的发展阶段可归纳为三个阶段
**第一阶段1960s-1990s刚性控制时代。** 工业机器人按固定程序执行重复动作几乎没有感知和自适应能力。Shakey机器人1966年是早期尝试将感知、规划与执行结合的代表但其计算能力极弱对环境变化的响应极为有限。
**第二阶段2000s-2010s感知与运动融合。** 以波士顿动力Boston Dynamics为代表的公司在四足和双足机器人的运动控制上取得突破实现了跑、跳、翻滚等高动态动作。但这阶段的“智能”主要体现在运动层面的鲁棒性任务级智能依然欠缺——机器人能走能跳却不理解为何要走、要去哪里。
**第三阶段2020年代至今大模型驱动的泛化智能。** 大语言模型如GPT系列、PaLM-E等的突破使机器人获得了自然语言理解和任务分解能力。机器人不再需要预设程序而是通过大模型理解用户指令自主规划动作序列。这是具身智能爆发的真正催化剂。
### 具身智能的不同技术路线
当前学术界和产业界对如何实现具身智能存在多条路径:
- **端到端学习**:摄像头输入→神经网络→电机输出,一步到位。数据需求极大,泛化能力依赖数据覆盖。
- **分层架构**:大模型做高层规划(“去厨房拿杯子”),运动控制模块负责执行细节(路径规划、避障、抓取姿态)。这种架构更易工程化部署。
- **示教学习Imitation Learning**通过人类远程操作Teleoperation或肢体示教让机器人学习特定任务的执行策略是目前最有效的数据收集方式之一。
- **强化学习**:在仿真环境中让机器人自行“试错”,通过奖励函数驱动策略优化。优势是数据量大、探索充分;劣势是策略迁移到真实环境时存在差异。
---
## 3. 宇树具身智能实践
### 战略定位:专注四足与双足机器人的全栈能力
宇树科技是全球少数同时具备四足机器人如Go系列、B系列和人形机器人整机自研能力的企业。其技术路线选择“从腿足运动出发逐步扩展至整机智能”与不少公司“先做手臂再做腿足”的路径形成对比。
杜老师认为,**腿足运动是机器人走向通用化的关键门槛**:轮式/履带式机器人只能适应平坦地形,而腿足机器人才具备在复杂人类环境中(楼梯、碎石、门槛)移动的潜力。宇树在四足运动控制上积累的算法和经验,直接迁移至人形机器人研发中。
### 技术路线:基于行业分工的模块化架构
宇树在内部实践中呼应了前述“大脑-小脑-本体”的分工理念:
- **本体(机构设计)**宇树在高扭矩密度电机、轻量化结构件、一体化关节设计上持续迭代。其四足机器人B2的负载能力和续航在国际同类产品中处于领先位置。
- **小脑(运动控制)**采用基于模型预测控制MPC与状态机结合的算法实现复杂地形下的自适应步态。在2022年冬奥会开幕式上宇树机器狗的群控表演展示了多机协同的稳定性。
- **大脑(具身智能)**宇树近年重点投入基于大模型的自然语言指令理解和环境感知。在2024年发布的人形机器人H1中集成了物体识别、语义建图、语言交互等功能模块。
### 数据困局的解决尝试
针对机器人学习数据匮乏的问题,宇树采取了“虚实结合”策略:
**虚拟端**搭建高保真物理仿真平台基于GPU并行训练强化学习策略每天可模拟数万小时的运动数据。在四足机器人的落足点规划、摔倒恢复等运动中仿真训练已能产出可直接部署的控制策略。
**真实端**通过众包模式和远程示教系统低成本收集人类操作数据操作员使用VR设备或手控设备远程“操控”机器人完成捡拾、搬运、开门等动作这些操作记录被转化为训练数据。杜老师指出未来一旦数据量足够机器人将从“被示教的对象”变为“自主学习的体”。
### 产品矩阵与落地场景
宇树现有产品覆盖消费级和行业级最小型号的Go系列四足面向个人消费者和科研用户B系列面向工业巡检、安防巡逻等场景H1、G1等人形机器人则瞄准服务、物流、教育等更复杂的交互场景。杜老师透露目前工业巡检类应用已实现初步商业化而人形机器人仍处于技术验证和早期市场导入阶段。
---
## 4. 未来展望
### 行业趋势具身智能是AI的终极出口
杜老师认为没有物理身体的AI是不完整的。当前大模型已经证明了“智能涌现”的可能性但只有当智能体能够感知、移动、操作时其能力边界才会真正扩展。他预测未来3-5年内**工业领域将是具身智能首先实现规模化落地的场景**,因为工业环境相对结构化、安全可控、成本效益清晰。家庭服务则需要更长时间——家庭环境的非结构化和高安全要求是更大挑战。
### 支撑条件:硬件成本下降、数据积累加速
推动具身智能走向实用的三个关键变量:
1. **硬件成本**:电机、减速器、传感器等核心部件的国产化正在快速拉低整机成本。宇树的定价策略也证明了这一点——其四足机器人消费版价格已降至万元级别。
2. **数据积累**遥操作和仿真技术逐步成熟数据瓶颈有望在未来2-3年内得到缓解。
3. **大模型进步**:高层的语义理解和推理能力越强,机器人的任务泛化能力就越强,对预设规则和人工微调的依赖就越低。
### 潜在的挑战与局限
杜老师也坦诚指出几个不容忽视的挑战:
- **安全与伦理**:具备行动能力的智能体一旦出现误判,可能造成物理伤害,这需要从硬件冗余、软件约束、法律规范多个层面共同解决。
- **能耗与续航**:高性能计算与高强度运动共同消耗大量能源,当前电池技术限制着机器人的连续工作时间和应用半径。
- **标准化缺失**:具身智能行业尚处于“各说各话”的阶段,数据格式、接口标准、评估维度均缺乏统一范式,不利于产业链协同。
---
### 延伸思考
听课时有一个感受:宇树的技术路线选择——“从腿足切入”而非“从手臂切入”——很有意思。这跟“先解决移动,再解决操作”的逻辑是一致的。但反过来想,轮式底盘+高精度的机械臂组合在成本、可靠性上可能远优于腿足方案。腿足的最大优势在于“跨障碍”但这在95%的室内场景中未必是刚需。为什么还要坚持做腿足?一种可能性是:宇树的目标市场并不局限于平坦室内环境,未来人形机器人的核心价值可能就在于它的“通用全身运动能力”,去应对未知、复杂、非常规的任务场景。从这个角度看,腿足是押注“通用性”的长期投入,而非短期商业效率最优解。
另外对“数据瓶颈”的讨论印象深刻。大模型时代机器人公司之间的竞争可能不只是算法能力的比拼更是数据获取效率和质量的比拼。谁能更快、更便宜地收集到海量、高质量的交互数据比如通过低成本遥操作、VR示教、仿真环境谁就有可能率先跨过泛化能力的门槛。硬件供应链差异可能会缩小数据护城河才是长期差异化所在。

View File

@ -0,0 +1,90 @@
---
date: 2026-06-14
type: course-analysis
tags: [机器人具身智能, 宇树科技]
---
> 本文共 **1850** 字 · 预计阅读 **6** 分钟
摘要课程围绕机器人具身智能的发展现状与产业实践展开杜鑫峰博士先分析了AI与机器人产业的分工逻辑与人形机器人爆发的背景进而梳理了具身智能的发展脉络与核心困难最后结合宇树科技的产品线与技术路径介绍了落地经验。笔记补充了后三节的内容力求呈现授课框架的完整性。
---
## 机器人具身智能发展与宇树科技实践
**授课老师**:杜鑫峰 博士(宇树科技副总经理,浙江大学客座教授)
**时间**2026年6月14日下午
**地点**:浙江大学
---
### 一、AI与机器人产业进展
业界对当前技术格局的判断趋于一致大语言模型的发展正在收敛中美在基础模型上的差距依然明显——中国在AI大模型领域短期内难以超越美国。但在机器人与具身智能的结合点上中美基本处于并驾齐驱的状态。
近两年机器人领域的融资规模急剧上升,资本和产业界普遍认为人形机器人将是终极形态:它应当兼具“能干”(执行复杂任务)、“智慧”(理解环境与指令)、“强健”(适应非结构化地形)、“灵敏”(精细操作与快速响应)四大特质。
**为什么人形机器人在2024年集中爆发** 核心原因在于AI大模型在语义理解、逻辑推理和任务规划上取得了突破使得机器人行业的研发分工得以重新梳理。当前主流的分工框架如下
- **强健本体**:机构设计与综合,负责机器人的机械结构、材料、关节驱动等物理基础。
- **敏捷小脑**:运动规划与控制,负责平衡、步态、力控、摔倒恢复等实时响应。
- **智慧大脑**:感知、定位与具身智能,负责理解场景、规划任务、决策交互。
其中,大脑的泛化能力是机器人进入家庭、服务场景的前提。具身智能的目标正是让通用人工智能从数字世界走向实体世界,赋予机器人主动感知与交互的能力。
**具身智能研究的核心困难**在于数据匮乏。与图像、文本等互联网上可获得的海量数据不同,机器人的交互数据几乎为零基础。目前有两种主流的数据获取手段:其一是让真实机器人部署在实际环境中,通过试错或示教采集交互数据;其二是借助工程化手段——利用仿真引擎自动生成大量合成场景与任务数据(例如随机生成障碍物、光照、物体摆放),从而降低对真实物理数据的依赖。
---
### 二、具身智能发展简述
具身智能并非2024年才出现的新概念。早在1950年代图灵就在论文中提出智能应当体现在与环境交互的能力上。但受限于算力、算法与传感器水平这一方向长期处于实验室探索阶段。
**技术路线演变**
- 早期:基于规则的控制(如状态机、有限自动机),适用于结构化环境,但难以应对不确定性。
- 中期基于模型的强化学习MBRL和视觉伺服利用仿真环境训练策略但仿真到现实的迁移sim-to-real始终是瓶颈。
- 当前:大规模多模态模型(如视觉-语言-动作模型VLA与模仿学习结合借助人类示教或远程操作收集高质量轨迹数据直接训练端到端策略。
**代表性方法**RT-1/RT-2Google、Octo多机构联合、π0联邦学习框架等通用操控模型Unitree的强化学习控制器在四足机器人上的成功应用也说明数据驱动的运动控制已能超越传统模型预测控制MPC的性能。
**主要挑战**:除了数据不足,还存在泛化性弱、鲁棒性差、实时性要求高等问题。目前具身智能多在受控环境中表现良好,但离“走进千家万户”仍有距离。行业共识是:需要更高效的学习算法(如基于世界模型的想象能力)以及更便宜、更标准化的硬件平台。
---
### 三、宇树具身智能实践
宇树科技的产品线覆盖四足机器人Go1、Go2、B2、Aliengo和人形机器人H1、G1。公司最早在2021年公开零售高性能四足机器人也是全球首家将四足机器狗从实验室推向消费级的厂商。
**技术路线**宇树的机器人本体以高强度材料、高扭矩关节和轻量化设计见长。控制层面团队开发了基于强化学习的敏捷运动控制器能够实现跑跳、上下楼梯、穿越障碍、抗扰动平衡等复杂运动并将其部署在嵌入式边缘计算平台上。感知与决策层面宇树支持激光雷达、深度相机、麦克风阵列等多传感器融合配合自研的导航与避障算法基于经验地图与原地建图结合可在无GPS环境中自主作业。
**具身智能的落地场景**
- **工业巡检**:在变电站、石化管道、矿山巷道中进行设备状态监测、热成像分析和气体检测。
- **安防巡逻**:配合可见光/红外相机,实现全天候巡逻与异常行为预警。
- **科研教育**提供二次开发接口支持Open Source的强化学习环境如Isaac Gym、Issac Lab高校和研究所利用宇树机器人验证新的算法。
- **服务与娱乐**Go系列作为消费级产品主打家庭陪伴、编程教育和交互体验。
**关键经验**杜鑫峰博士在课程中强调宇树的实践验证了“硬件标准化软件模块化”的思路。通过将运动控制、感知、操控等模块解耦使得具身智能研究可以专注在上层算法而不必每次从底层硬件开始构建。此外宇树在仿真环境如Unitree Mujoco Sim中开源了机器人模型和控制接口促进了学术社区的数据共享与算法复现。
---
### 四、未来展望
具身智能的终极目标是构建能够自主完成任意复杂任务的通用机器人。但目前仍面临以下瓶颈:
1. **数据闭环缺失**:真实世界的交互数据难以大规模获取,且标注成本极高。未来需要依赖自监督学习、多模态融合以及仿真数据的自动生成。
2. **泛化性不足**当前模型往往在训练环境内表现优秀环境稍有变化光照、物体形态、背景遮挡即失效。世界模型World Model引入物理因果推理可能是一个突破方向。
3. **安全性与伦理**:机器人进入人类生活空间,必须保证操作的可靠性、人机交互的安全性以及隐私数据的保护。行业需要建立可验证的认证标准。
4. **成本与供应链**:高扭矩关节、灵巧手、高分辨率深度相机等核心部件仍偏贵,降本需要产业链协同。
**可能的演进路径**
- 短期2-3年专用场景工厂、仓储、特种巡检率先落地采用“人机协作”模式机器人完成重复性或危险性高的工作。
- 中期3-5年家用服务机器人清洁、整理、陪伴开始渗透基于大模型的自然语言交互成为标配。
- 长期5-10年人形机器人成为通用平台通过软件更新即可扩展能力类似智能手机之于应用。
杜鑫峰博士认为,宇树将继续坚持“足式机器人”与“灵巧操作”双轮驱动,在硬件上降低成本、提高可靠性,在软件上拥抱开放生态,推动具身智能从实验室走进真实世界。
---
### 延伸思考
课程的核心信息在于“分工”与“数据”。当前大模型开源生态日趋丰富但机器人行业的独特瓶颈在于数据获取的高成本与低标准性。宇树的做法开放仿真环境提供标准化硬件接口本质上是试图降低研究者进入的门槛形成数据飞轮。但值得追问的是仿真数据与真实数据之间的“现实差距”能否通过算法域随机化、GAN完全弥补此外人形机器人是否是唯一的终极形态对于某些任务如管道探测、水下作业非人形蛇形、四足可能更高效通用性本身不一定依赖于人形。课程并未深入讨论这部分但可能是未来产业需要细化的问题。