清华大学朱军教授团队, NVIDIA Deep Imagination 研究组与斯坦福 Stefano Ermon 团队联合提出了一种全新的扩散模型强化学习(RL)范式 ——Diffusion Negative-aware FineTuning (DiffusionNFT)。该方法首次突破现有 ...
这项由普林斯顿大学语言与智能实验室(Princeton Language and Intelligence)主导、联合复旦大学与清华大学研究人员共同完成的研究,于2026年5月以预印本形式发布,论文编号为arXiv:2605.00347。感兴趣 ...
这项由弗吉尼亚大学与圣路易斯华盛顿大学联合开展的研究,以预印本形式发布于2026年5月20日,论文编号为arXiv:2605.21468,有兴趣深入了解的读者可通过该编号查询完整原文。 训练一个会思考 ...
就在今天,被称为“强化学习之父”的 Richard Sutton 在社交平台 X 上突然宣布,他与合作者 Khurram Javed 已经离开由传奇游戏开发者 John Carmack 创办的 AI 公司 Keen ...
在人工智能领域,大语言模型的强化学习训练常被视为推动技术进步的核心动力。然而,天津大学与阿里巴巴联合研究团队发现,当前主流的训练机制存在一个被长期忽视的隐患:训练过程中看似不断优化的模型,在实际部署时可能并未提升性能,甚至可能退化。这一发现挑战了传统强化学习的优化逻辑,并为解决该问题提出了创新方案。 研究指出,大语言模型的训练与部署涉及两套独立系统:训练引擎负责模型参数更新,推理引擎负责生成用户可 ...
强化学习能力强大,几乎已经成为推理模型训练流程中的标配,也有不少研究者在探索强化学习可以为大模型带来哪些涌现行为。 现在,问题来了:要让大模型学会推理,强化学习是必需的吗?
强化学习奠基人、2024年图灵奖得主Richard Sutton宣布,自己已和学生Khurram Javed离开John Carmack创办的Keen Technologies,另起炉灶成立Oak Lab。 69岁正是“创”的年纪! 强化学习奠基人、2024年图灵奖得主Richard Sutton宣布,自己已和学生Khurram Javed离开John Carmack创办的Keen Technol ...