教程 OpenDuckMini强化学习框架入门教程 下的文章
概述
原文: Overview - Open_Duck_Playground
目的与范围
Open Duck Playground 是一个强化学习框架,专为 Open Duck Mini V...
安装与设置
学习如何搭建OpenDuckMini强化学习框架的开发学习环境
使用 uv 包管理器安装
Open Duck Playground 使用 uv 作为包管理器——一个用 Rust ...
项目结构
进一步理解整个OpenDuckMini强化学习框架项目结构
目录树
.
├── pyproject.toml # 项目配置与依赖声明
├── README.md...
环境架构
进一步理解软件环境架构
分层架构概览
Open Duck Playground 的环境系统采用分层设计,基于 MuJoCo (MJX) 物理引擎构建。这种分层结构将通用机器人仿真逻...
基础环境
进一步理解基础环境相关内容,包含类定义,关节管理系统,观测空间,动作空间等
OpenDuckMiniV2Env 类
OpenDuckMiniV2Env 是 base.py 中定义的...
摇杆环境
理解摇杆是如何控制机械鸭,包含配置,摇杆命令,速度跟踪,观测构建,动作模拟等
概述
Joystick 类(定义在 joystick.py 中)是 Open Duck Mini V2...
站立环境
理解机械鸭是如何实现站立和控制,包含类结构和方法,配置参数,奖励系统,命令采样,观测构建,训练方法等
概述
Standing 类(定义在 standing.py 中)与 Joyst...
训练系统
理解如何实现训练模型,包含训练管线,runner架构,PPO训练参数,回调机制,数据流,训练命令和技巧等
概述
Open Duck Playground 的训练系统基于 Brax ...
Runner 架构
理解Runner架构,包含数据流,基类,实现类,检查点系统,训练配置
概述
Runner 是训练系统的核心调度器,负责协调环境、策略、随机化和日志记录等组件。Open D...
域随机化
理解域随机化,包含核心函数,随机化参数,随机化范围分析,实现细节,域随机化的作用,与训练系统的集成等
概述
域随机化(Domain Randomization) 是强化学习中一种重...
检查点与导出
理解检查点和导出,包含检查点保存,ONNX 模型导出,推理使用 ONNX 模型,从检查点恢复训练等
概述
训练过程中,系统的检查点和模型导出机制确保训练成果被持久化保存,并能够...
推理系统
理解推理系统,包含推理管线,核心组件,推理流程,与训练环境的区别,用户输入处理,实时性能,观测保存,参考运动可视化和部署选项等
概述
推理系统(Inference System)负...
MuJoCo 推理
理解MuJoCo推理,包含MJInferBase 基类,MjInfer 主类,用户输入处理,实时步态周期,动作平滑滤波器等
概述
MuJoCo 推理系统是 Open Du...
ONNX 集成
理解ONNX集成,包含OnnxInfer类,ONNX模型格式,从JAX到ONNX的转换,ONNX推理的性能,与MuJoCo推理的集成,导出与验证,部署到真实机器人和兼容性等
...
机器人模型
理解机器人模型,包含模型文件,机器人层级结构,运动学配置,动力学属性,执行器配置,物理引擎配置,碰撞几何和3D 视觉模型等
概述
Open Duck Mini V2 的机器人模型...
机器人模型XML结构
理解机器人模型XML结构,包含MJCF 格式,Body/Joint 层级,主要 XML 元素,场景 XML 结构和include 机制等
MJCF 格式
MuJoCo ...
关节系统
理解机器人关节系统,包含关节分类,关节定义,驱动类型,回差建模和关节坐标系统等
概述
Open Duck Mini V2 的关节系统包括主动关节(由舵机驱动)、浮动基座关节(自由运...
传感器配置
理解传感器及配置,包含传感器配置文件,传感器分类,传感器使用,传感器噪声模拟,接触检测和传感器在常量中的定义等
概述
Open Duck Mini V2 在 MJCF 模型中定义...
地形生成
理解地形生成,包含地形配置选项,场景文件结构,平坦地形,粗糙地形,渲染配置,初始姿态和地形选择策略等
概述
Open Duck Playground 中的地形通过 MuJoCo 的...
奖励系统
理解奖励系统,包含奖励结构,奖励分类,奖励组合模式,奖励函数详解,模仿奖励和奖励配置等
概述
奖励系统是强化学习的核心引导机制。Open Duck Playground 在 pla...
- 1
- 2
- 后一页 »