07 2026 档案

摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (14) Teacher 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (14) Teacher0x00 概要0x01 基础背景1.1 完整数据流1.2 关键点公式代 阅读全文
posted @ 2026-07-29 20:57 罗西的思考 阅读(86) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (13) OPD实现 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (13) OPD实现0x00 概要0x01 基础背景1.1 通俗讲解1.2 数学形式1.3 OPD 阅读全文
posted @ 2026-07-28 20:12 罗西的思考 阅读(97) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO0x00 概要0x01 GRPO基础1.1 GRPO 解读PPOGRPOGroup 阅读全文
posted @ 2026-07-27 20:25 罗西的思考 阅读(88) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (11) 算法总体实现 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (11) 算法总体实现0x00 概要0x01 基础背景1.1 架构1.2 算法三种训练方法核心设 阅读全文
posted @ 2026-07-23 20:48 罗西的思考 阅读(98) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (10) PRM 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (10) PRM0x00 概要0x01 基础知识1.1 PRM如何解决Agentic RL的稀疏梯度问 阅读全文
posted @ 2026-07-22 20:58 罗西的思考 阅读(132) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (9) Reward Judging 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (9) Reward Judging0x00 概要0x01 Reward 基础1. 阅读全文
posted @ 2026-07-20 20:35 罗西的思考 阅读(77) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (8) Environment 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (8) Environment0x00 概要0x01 环境建模基础1.1 标准 RL 系 阅读全文
posted @ 2026-07-16 21:13 罗西的思考 阅读(105) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (7) Policy Serving 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (7) Policy Serving0x00 概要0x01 基础1.1 架构1.2 阅读全文
posted @ 2026-07-14 20:19 罗西的思考 阅读(87) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合 目录【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合0x00 概要0x01 为什么需要两个算法?1.1 先想清楚要解决什么问题1.2 闭环总览1.3 三阶段逻辑链条0x02 LWD 论文算法2.1 算法图例 阅读全文
posted @ 2026-07-13 20:28 罗西的思考 阅读(88) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】QAM:基于伴随匹配的 Q-learning 流策略优化 目录【机器人 / 强化学习】QAM:基于伴随匹配的 Q-learning 流策略优化0x00 概要1.1 核心问题:Flow 策略的优化困境1.1 为什么 Flow 策略难以用 RL 优化?1.2 三种候选方案0x02 阅读全文
posted @ 2026-07-11 19:06 罗西的思考 阅读(111) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】DIVL:分布隐式价值学习 目录【机器人 / 强化学习】DIVL:分布隐式价值学习0x00 概要0x01 从 IQL 到 DIVL:为什么标量不够用?1.1 IQL 的遗产:在已知数据中"沙里淘金"1.2 为什么平均数会骗人?1.3 从"给平均分"到"看清各种可能性"0x02 阅读全文
posted @ 2026-07-09 19:30 罗西的思考 阅读(93) 评论(0) 推荐(1)
摘要:【机器人 / 强化学习】IQL(Implicit Q-Learning):离线强化学习的隐式价值提取 目录【机器人 / 强化学习】IQL(Implicit Q-Learning):离线强化学习的隐式价值提取0x00 概要1.1 核心哲学:在已知数据中"沙里淘金"1.1 离线学习的"贪婪陷阱"1.2 阅读全文
posted @ 2026-07-07 19:27 罗西的思考 阅读(123) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】LWD(Learning while Deploying)机器人持续进化的强化学习框架 目录【机器人 / 强化学习】LWD(Learning while Deploying)机器人持续进化的强化学习框架0x00 概要0x01 背景:为什么需要 LWD?1.1 真实世界不是一个 阅读全文
posted @ 2026-07-06 19:35 罗西的思考 阅读(111) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】HIL-SERL 工程篇:人类在环的工程架构与物理设计 目录【机器人 / 强化学习】HIL-SERL 工程篇:人类在环的工程架构与物理设计0x00 概要0x01 系统架构总览1.1 逻辑架构1.2 物理拓扑1.3 部署拓扑与启动顺序1.4 独立运行的组件清单1.5 单步交互时 阅读全文
posted @ 2026-07-03 20:09 罗西的思考 阅读(150) 评论(1) 推荐(0)
摘要:【机器人 / 强化学习】HIL-SERL 算法篇:HG-DAgger 与 RLPD —— 从模仿到超越的训练双阶段 目录【机器人 / 强化学习】HIL-SERL 算法篇:HG-DAgger 与 RLPD —— 从模仿到超越的训练双阶段0x00 概要0x01 HG-DAgger 的核心思想:人类门控的 阅读全文
posted @ 2026-07-01 20:14 罗西的思考 阅读(216) 评论(0) 推荐(0)