强化学习50年:从 Samuel Checkers 到 AlphaGo / MuZero / RLHF 📅 2026年9月29日 强化学习的理论核心是 **Bellman 方程**,由 Richard Bellman 在 1957 年提出(他在 RAND 公司工作期间)。Bellman 方程描述了一个智能体在环境中做决策时,长期累积回报的最优求解方式。