course: 宇树科技杜博士课程分析 153620
This commit is contained in:
128
ai-insights/daily/2026-06-14/01_宇树科技课程分析.md
Normal file
128
ai-insights/daily/2026-06-14/01_宇树科技课程分析.md
Normal file
@ -0,0 +1,128 @@
|
|||||||
|
# 机器人具身智能发展与宇树科技实践
|
||||||
|
|
||||||
|
授课老师:杜鑫峰 博士(宇树科技副总经理)
|
||||||
|
时间:2026年6月14日下午
|
||||||
|
地点:浙江大学
|
||||||
|
|
||||||
|
杜鑫峰博士曾任浙江国自机器人技术股份有限公司副总裁,现担任浙江大学客座教授兼控制学院创业导师,深耕机器人研发与产业推广数十年,是国内特种机器人与具身智能产业化的资深从业者,兼具科研、管理与市场视野。宇树科技是全球最早公开零售高性能四足机器人的公司之一,曾受邀参加2021年牛年央视春晚、2022冬奥会开幕式,专注于消费级、行业级高性能通用足式/人形机器人及灵巧机械臂的自主研发。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 1. AI与机器人产业进展
|
||||||
|
|
||||||
|
### 当前格局:AI大模型与机器人赛道分化
|
||||||
|
|
||||||
|
业界普遍认为,大语言模型的演进趋势已趋向收敛——技术路径、训练方法、基础设施逐步标准化,中国在这一方向上与美国的差距较为明显,追赶难度较大。但机器人具身智能领域则呈现不同局面:中美并驾齐驱,各有优势。造成这种分野的核心原因在于,机器人涉及硬件制造、运动控制、系统集成等复杂工程链条,并非单纯算法竞赛,而中国在产业链完整性和应用落地方面具备独特优势。
|
||||||
|
|
||||||
|
近两年,机器人领域的融资规模显著增长,尤其是人形机器人方向吸引了大量资本关注。杜老师给出判断:人形机器人将是未来机器人的终极形态,其核心特征可概括为四个关键词——能干(任务执行能力)、智慧(感知与决策)、强健(硬件可靠性与耐久性)、灵敏(动态响应与协调性)。
|
||||||
|
|
||||||
|
### 人形机器人为何在2024年集中爆发
|
||||||
|
|
||||||
|
2024年成为人形机器人的爆发节点,直接驱动因素是大语言模型在智能推理、自然交互方面取得突破,这使得机器人行业内部形成了清晰的分工逻辑。
|
||||||
|
|
||||||
|
行业按照机器人共性关键技术划分出三条分工路线:
|
||||||
|
|
||||||
|
- **强健本体**——机构设计与综合:负责机器人的机械结构、材料选型、关节驱动等硬件基础,解决“能不能站稳、能不能负重”的问题。
|
||||||
|
- **敏捷小脑**——运动规划与控制:负责行走、抓取、避障等底层运动控制,解决“能不能走得稳、动作准”的问题。
|
||||||
|
- **智慧大脑**——感知、定位与具身智能:负责环境理解、任务规划、人机交互等高层推理,解决“能不能理解环境并自主决策”的问题。
|
||||||
|
|
||||||
|
杜老师特别强调,**大脑的泛化能力**是机器人从实验室走向千家万户的基础。过去的机器人只能完成预设的特定动作,一旦环境变化就失效,而具身智能追求的正是让机器人在开放、动态的真实世界中自主应对未知场景。
|
||||||
|
|
||||||
|
### 什么是具身智能
|
||||||
|
|
||||||
|
具身智能(Embodied Intelligence)的核心目标,是让通用人工智能从数字世界走向实体世界。如果说传统AI停留在屏幕和数据中,具身智能则要求智能体拥有物理身体,能在真实环境中感知、行动和交互。这不仅是算法问题,更是系统问题——它将感知、控制、规划、执行整合在一个物理实体上。
|
||||||
|
|
||||||
|
### 具身智能的核心困境:数据瓶颈
|
||||||
|
|
||||||
|
机器人学习面临的最大瓶颈是缺乏数据。与图片和文字的海量积累形成鲜明对比的是,机器人可以学习的交互数据极为匮乏。原因在于:机器人数据采集成本高,需要真实环境、物理交互、重复试验,无法像标注图片那样低成本规模化。
|
||||||
|
|
||||||
|
目前主流的数据收集路径有两条:
|
||||||
|
|
||||||
|
1. 让具身本体在真实环境中采集交互数据,通过实际试错和人类示教来积累经验
|
||||||
|
2. 用工程手段(仿真引擎、自动场景生成)取代传统人工数据收集,在虚拟环境中大规模生成训练数据
|
||||||
|
|
||||||
|
这两种方法各有局限:真实数据成本高、样本少;仿真数据存在与现实之间的“Sim-to-Real Gap”,即模拟环境的模型偏差会导致学到的策略在真实世界中失效。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 2. 具身智能发展简述
|
||||||
|
|
||||||
|
### 从机械执行到智能涌现
|
||||||
|
|
||||||
|
具身智能并非全新概念,其思想可追溯至20世纪中期的控制论和1950年代图灵对智能体与物理世界交互的探讨。但真正意义上的发展阶段可归纳为三个阶段:
|
||||||
|
|
||||||
|
**第一阶段(1960s-1990s):刚性控制时代。** 工业机器人按固定程序执行重复动作,几乎没有感知和自适应能力。Shakey机器人(1966年)是早期尝试将感知、规划与执行结合的代表,但其计算能力极弱,对环境变化的响应极为有限。
|
||||||
|
|
||||||
|
**第二阶段(2000s-2010s):感知与运动融合。** 以波士顿动力(Boston Dynamics)为代表的公司,在四足和双足机器人的运动控制上取得突破,实现了跑、跳、翻滚等高动态动作。但这阶段的“智能”主要体现在运动层面的鲁棒性,任务级智能依然欠缺——机器人能走能跳,却不理解为何要走、要去哪里。
|
||||||
|
|
||||||
|
**第三阶段(2020年代至今):大模型驱动的泛化智能。** 大语言模型(如GPT系列、PaLM-E等)的突破使机器人获得了自然语言理解和任务分解能力。机器人不再需要预设程序,而是通过大模型理解用户指令,自主规划动作序列。这是具身智能爆发的真正催化剂。
|
||||||
|
|
||||||
|
### 具身智能的不同技术路线
|
||||||
|
|
||||||
|
当前学术界和产业界对如何实现具身智能存在多条路径:
|
||||||
|
|
||||||
|
- **端到端学习**:摄像头输入→神经网络→电机输出,一步到位。数据需求极大,泛化能力依赖数据覆盖。
|
||||||
|
- **分层架构**:大模型做高层规划(“去厨房拿杯子”),运动控制模块负责执行细节(路径规划、避障、抓取姿态)。这种架构更易工程化部署。
|
||||||
|
- **示教学习(Imitation Learning)**:通过人类远程操作(Teleoperation)或肢体示教,让机器人学习特定任务的执行策略,是目前最有效的数据收集方式之一。
|
||||||
|
- **强化学习**:在仿真环境中让机器人自行“试错”,通过奖励函数驱动策略优化。优势是数据量大、探索充分;劣势是策略迁移到真实环境时存在差异。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 3. 宇树具身智能实践
|
||||||
|
|
||||||
|
### 战略定位:专注四足与双足机器人的全栈能力
|
||||||
|
|
||||||
|
宇树科技是全球少数同时具备四足机器人(如Go系列、B系列)和人形机器人整机自研能力的企业。其技术路线选择“从腿足运动出发,逐步扩展至整机智能”,与不少公司“先做手臂再做腿足”的路径形成对比。
|
||||||
|
|
||||||
|
杜老师认为,**腿足运动是机器人走向通用化的关键门槛**:轮式/履带式机器人只能适应平坦地形,而腿足机器人才具备在复杂人类环境中(楼梯、碎石、门槛)移动的潜力。宇树在四足运动控制上积累的算法和经验,直接迁移至人形机器人研发中。
|
||||||
|
|
||||||
|
### 技术路线:基于行业分工的模块化架构
|
||||||
|
|
||||||
|
宇树在内部实践中呼应了前述“大脑-小脑-本体”的分工理念:
|
||||||
|
|
||||||
|
- **本体(机构设计)**:宇树在高扭矩密度电机、轻量化结构件、一体化关节设计上持续迭代。其四足机器人B2的负载能力和续航在国际同类产品中处于领先位置。
|
||||||
|
- **小脑(运动控制)**:采用基于模型预测控制(MPC)与状态机结合的算法,实现复杂地形下的自适应步态。在2022年冬奥会开幕式上,宇树机器狗的群控表演展示了多机协同的稳定性。
|
||||||
|
- **大脑(具身智能)**:宇树近年重点投入基于大模型的自然语言指令理解和环境感知。在2024年发布的人形机器人H1中,集成了物体识别、语义建图、语言交互等功能模块。
|
||||||
|
|
||||||
|
### 数据困局的解决尝试
|
||||||
|
|
||||||
|
针对机器人学习数据匮乏的问题,宇树采取了“虚实结合”策略:
|
||||||
|
|
||||||
|
**虚拟端**:搭建高保真物理仿真平台,基于GPU并行训练强化学习策略,每天可模拟数万小时的运动数据。在四足机器人的落足点规划、摔倒恢复等运动中,仿真训练已能产出可直接部署的控制策略。
|
||||||
|
|
||||||
|
**真实端**:通过众包模式和远程示教系统,低成本收集人类操作数据:操作员使用VR设备或手控设备,远程“操控”机器人完成捡拾、搬运、开门等动作,这些操作记录被转化为训练数据。杜老师指出,未来一旦数据量足够,机器人将从“被示教的对象”变为“自主学习的体”。
|
||||||
|
|
||||||
|
### 产品矩阵与落地场景
|
||||||
|
|
||||||
|
宇树现有产品覆盖消费级和行业级:最小型号的Go系列(四足)面向个人消费者和科研用户;B系列面向工业巡检、安防巡逻等场景;H1、G1等人形机器人则瞄准服务、物流、教育等更复杂的交互场景。杜老师透露,目前工业巡检类应用已实现初步商业化,而人形机器人仍处于技术验证和早期市场导入阶段。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 4. 未来展望
|
||||||
|
|
||||||
|
### 行业趋势:具身智能是AI的终极出口
|
||||||
|
|
||||||
|
杜老师认为,没有物理身体的AI是不完整的。当前大模型已经证明了“智能涌现”的可能性,但只有当智能体能够感知、移动、操作时,其能力边界才会真正扩展。他预测,未来3-5年内,**工业领域将是具身智能首先实现规模化落地的场景**,因为工业环境相对结构化、安全可控、成本效益清晰。家庭服务则需要更长时间——家庭环境的非结构化和高安全要求是更大挑战。
|
||||||
|
|
||||||
|
### 支撑条件:硬件成本下降、数据积累加速
|
||||||
|
|
||||||
|
推动具身智能走向实用的三个关键变量:
|
||||||
|
|
||||||
|
1. **硬件成本**:电机、减速器、传感器等核心部件的国产化正在快速拉低整机成本。宇树的定价策略也证明了这一点——其四足机器人消费版价格已降至万元级别。
|
||||||
|
2. **数据积累**:遥操作和仿真技术逐步成熟,数据瓶颈有望在未来2-3年内得到缓解。
|
||||||
|
3. **大模型进步**:高层的语义理解和推理能力越强,机器人的任务泛化能力就越强,对预设规则和人工微调的依赖就越低。
|
||||||
|
|
||||||
|
### 潜在的挑战与局限
|
||||||
|
|
||||||
|
杜老师也坦诚指出几个不容忽视的挑战:
|
||||||
|
- **安全与伦理**:具备行动能力的智能体一旦出现误判,可能造成物理伤害,这需要从硬件冗余、软件约束、法律规范多个层面共同解决。
|
||||||
|
- **能耗与续航**:高性能计算与高强度运动共同消耗大量能源,当前电池技术限制着机器人的连续工作时间和应用半径。
|
||||||
|
- **标准化缺失**:具身智能行业尚处于“各说各话”的阶段,数据格式、接口标准、评估维度均缺乏统一范式,不利于产业链协同。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 延伸思考
|
||||||
|
|
||||||
|
听课时有一个感受:宇树的技术路线选择——“从腿足切入”而非“从手臂切入”——很有意思。这跟“先解决移动,再解决操作”的逻辑是一致的。但反过来想,轮式底盘+高精度的机械臂组合在成本、可靠性上可能远优于腿足方案。腿足的最大优势在于“跨障碍”,但这在95%的室内场景中未必是刚需。为什么还要坚持做腿足?一种可能性是:宇树的目标市场并不局限于平坦室内环境,未来人形机器人的核心价值可能就在于它的“通用全身运动能力”,去应对未知、复杂、非常规的任务场景。从这个角度看,腿足是押注“通用性”的长期投入,而非短期商业效率最优解。
|
||||||
|
|
||||||
|
另外,对“数据瓶颈”的讨论印象深刻。大模型时代,机器人公司之间的竞争可能不只是算法能力的比拼,更是数据获取效率和质量的比拼。谁能更快、更便宜地收集到海量、高质量的交互数据(比如通过低成本遥操作、VR示教、仿真环境),谁就有可能率先跨过泛化能力的门槛。硬件供应链差异可能会缩小,数据护城河才是长期差异化所在。
|
||||||
Reference in New Issue
Block a user