在环境中试错学习

MDP 形式化决策;Actor-Critic 同时学策略与价值;TD 自举;ε-贪心平衡探索与利用。

模块 0 · 概览

行动概览

模块 0b · 理论基础

Bellman 方程

状态价值的递归定义 — 理解 TD 与 Actor-Critic 的数学根基。

模块 1 · MDP

智能体环

模块 2 · 学习

Actor-Critic 与 TD

模块 3 · 探索

ε-贪心

模块 4 · 对比

概念一张表

自由实验室

互动实验室