
写完宇树仿真岗面试那篇之后,我在评论区看到一个说法:"宇树最核心的算法岗不是控制也不是仿真,是强化学习。"这话有一定道理——宇树的Go2和H1上跑的步态策略,很大一部分都是RL训出来的。跟传统控制方法比,RL策略能学到更自然的步态、更好的地形适应能力,而且一旦训好部署,推理速度极快。这篇聊宇树·强化学习算法工程师面试,覆盖PPO和SAC算法、奖励函数设计和步态学习三个方向。宇树的RL面试跟互联网公司考推荐系统的RL完全不同,他们要的是你能在Isaac Gym里把一条机器狗训到能跑能跳。PPO和SAC:算法原理必须烂熟面试官的开场问题通常是算法层面的。"PPO和SAC的核心区别是什么?各自适合什么机器人任务?"PPO(Proximal Policy Optimization)是on-policy算法。它用一个截断的目标函数限制每次策略更新的幅度——新策略和旧策略的概率比被clip在[1-ε, 1+ε]之间,防止更新步子迈太大导致策略崩溃。PPO的优点是实现简单、超参数不敏感、训练稳定,缺点是样本效率低(每批数据用完就丢),需要大量环境交互。SAC(Soft Actor-Critic)是off-policy算法。它的目标函数里加了一个熵正则化项——不仅最大化累积奖励,还最大化策略的熵,鼓励策略探索更多动作。SAC用replay buffer存历史数据反复学习,样本效率比PPO高很多。缺点是实现复杂(需要同时维护actor网络、两个critic网络