17.2.2 - 值函数 - 明确强化学习中的值函数分解
作者: MarianSlassi创建于 2026年7月4日更新于 2026年7月4日
https://GitHub.com/d2l-ai/d2l-en/pull/2727 修改了价值函数的数学表示,以明确将状态价值分解为即时奖励和预期未来价值。 第 17.2.2 节 价值函数
内容来源: d2l-ai/d2l-en
https://GitHub.com/d2l-ai/d2l-en/pull/2727 修改了价值函数的数学表示,以明确将状态价值分解为即时奖励和预期未来价值。 第 17.2.2 节 价值函数
内容来源: d2l-ai/d2l-en