强化学习

强化学习是「让机器学会做决策」的核心范式:从 AlphaGo 击败人类顶尖棋手,到 RLHF 让 ChatGPT 走入亿级用户,再到 2024 年起 Reasoning RL 推动推理模型(o1、DeepSeek-R1)跃迁,RL 持续刷新…