生猛活海鲜大排档

Search posts…

AI/RL2

后训练

后训练

PPO 核心思想:裁剪概率比限制策略更新步长,配合 GAE 优势与多轮 epoch 优化的速记推导。

AI 2025 Nov 01 3 min read
强化学习

强化学习

强化学习系统化笔记:MDP 记号、蒙特卡洛、TD、SARSA、Q 学习与 DQN 等算法脉络。

AI 2025 Nov 01 20 min read
笔记 113 posts 碎碎念 435 posts 流水账 105 posts 散文 10 posts