强化学习在近几年热度快速上升。早年这项技术多用于游戏AI、机器人控制,普通大众很难接触。如今大模型对齐、机器人研发、数学定理证明领域,都在落地应用。变化幅度很大,挑几个值得关注的方向简单说说。
大模型把强化学习带出圈了
过去提到强化学习,大家最先想到AlphaGo围棋程序。现在不一样,ChatGPT依托的RLHF,也就是基于人类反馈的强化学习,让这项技术被大众熟知。简单来讲,模型生成回答内容,人类给出打分,模型依靠分数调整自身输出策略。原理看着简单,实际落地效果很突出。

这个方向衍生不少新研究思路。有团队把bug报告结构化信息嵌入RLHF流程,不再只判断回答对错,而是让模型区分预期结果和实际输出,更精准捕捉用户真实诉求。还有CoRLHF这类方案,策略模型与奖励模型协同迭代优化,奖励模型不会固定不变。换个通俗说法,过去模式类似老师出题学生作答,现在老师和学生同步优化进步。
机器人这块是真在落地了
机器人领域的强化学习,早期大多只在仿真环境运行,部署到实体设备经常失效。2025年出现标志性事件,智元机器人真机强化学习方案落地龙旗科技产线,技术从论文推进到车间生产。属于行业首次,意义重大。
技术层面同样取得突破。上海交大联合百度推出dVLA-RL框架,首次打通经典PPO算法与离散扩散VLA模型的强化学习训练链路。提升效果很直观,RoboTwin 2.0基准测试中,任务成功率从61.4%提升至92.0%,推理延迟从728毫秒压缩到387毫秒。另一项RobotxR1研究,使用仅1.5B参数的小型模型,依靠闭环强化学习实现机器人控制,最终表现超过云端GPT-4o,控制适应性得分63.3%对比58.5%。设备端小模型自主学习,效果优于云端大模型远程操控,这条路线潜力很高。
清华大学发布《具身智能发展报告(2025)》,预判未来一到三年,能够人工介入接管的具身智能,会在半封闭场景批量落地。机器人还无法独立处理全部任务,但有人值守前提下,可以承担实际工作。
让机器自己发明算法
这个方向最有探索价值。DeepMind在Nature刊发论文,让AI自主发掘强化学习算法,这套自动生成的规则,在Atari测试基准上优于全部人工设计算法,在训练阶段从未见过的任务里依旧可以正常运行。过去强化学习算法全部依靠人工设计,现在机器能够自主找到更优方案,这个突破打开很大想象空间。
世界模型降低训练开销
强化学习长期存在一大短板,数据消耗巨大。真实场景试错成本高昂,仿真环境训练完成,移植到真机经常出现适配问题。世界模型思路,是让AI先在虚拟环境模拟场景,不用真实硬件反复试错,大幅提升训练效率。
DiWA方案依托世界模型完成扩散策略离线微调,仅需要几百万次离线交互就能适配新任务,相比传统无模型方法,物理交互次数减少多个数量级。DyMoDreamer更进一步,引入动态调制机制,在Atari 100k基准拿到156.6%人类归一化分数,只用十万步交互,表现就超过人类玩家。
游戏依旧是最好的试验场
游戏一直作为大模型的试验载体。腾讯基于《王者荣耀》搭建TiG框架,AI除完成对局,还能解释自身决策逻辑。比如输出判断:这个防御塔防守薄弱适合进攻,需要留意埋伏。训练之后Qwen3-14B决策准确率达到90.91%,高于DeepSeek-R1的86.67%。过去游戏AI擅长操作却无法解释思路,语言模型擅长表达不擅长实操,两类技术正在融合。
数学证明领域同样取得进展。AlphaProof使用强化学习实现自动定理证明,水平达到IMO 2024人类参赛选手水准。后期迭代版本的AI不仅能力更强,效率也更高,最终版本解决约30%题目,仅需300次搜索模拟,早期版本无论增加多少次搜索都达不到同等效果。
多智能体方向持续推进
多个AI协同工作方向产出不少新成果。有研究搭建三重奖励框架,包含组奖励、个体奖励、联合行动奖励,星际争霸对战任务胜率相比基础方案提升20%。还有框架结合大语言模型与多智能体强化学习,LLM负责高层战略规划,MARL负责底层执行。简单理解,大语言模型充当指挥官,MARL智能体负责落地执行。
现存瓶颈
虽然成果很多,但还有不少问题没有妥善解决。
样本效率偏低。人类学习新技能尝试少数几次就能掌握,AI需要数百万次试错。稀疏奖励难题依旧存在,大部分场景不会持续给出反馈,AI很难判断自身行为好坏。奖励函数设计难度高,一旦设计有偏差,AI会寻找预料之外的漏洞刷高分。泛化能力也是长期痛点,一个环境训练成型的策略,更换场景之后性能大幅下滑。
但结合近两年趋势,这些难点正在逐步攻克。世界模型优化样本效率,大语言模型辅助奖励设计,元学习提升泛化能力。不存在万能解决方案,各个技术路线都在稳步推进。



