摩尔线程大模型对齐研究获国际顶级学术会议认可:URPO 框架入选 AAAI 2026
【导语】11 月 13 日消息,摩尔线程提出的新一代大语言模型对齐框架 URPO 统一奖励与策略优化,相关论文被 AAAI 2026 收录。该框架融合两大角色并同步优化,从三方面攻克技术难题,实验显示多项指标超越传统基线,且已在自研计算卡上稳定运行,还完成主流强化学习框架适配 。

11 月 13 日消息,摩尔线程提出的新一代大语言模型对齐框架 —— URPO 统一奖励与策略优化,相关研究论文近日被人工智能领域的国际顶级学术会议 AAAI 2026 收录,为简化大模型训练流程、突破模型性能上限提供了全新的技术路径。
据介绍,在题为《URPO:A Unified Reward & Policy Optimization Framework for Large Language Models》的论文中,摩尔线程 AI 研究团队提出了 URPO 统一奖励与策略优化框架,将“指令遵循”(选手)和“奖励评判”(裁判)两大角色融合于单一模型中,并在统一训练阶段实现同步优化。URPO 从以(yǐ)下(xià)三(sān)方(fāng)面(miàn)攻(gōng)克技术挑战:
数据格式统一:将异构的偏好数据、可验证(zhèng)推(tuī)理(lǐ)数(shù)据(jù)和开放式指令数据,统一重构为适用于 GRPO 训练的信号格式。
自我奖励循环:针对开放式指令,模型生成多个候选回答后,自主调用其“裁判”角色进行评分,并将结果作为 GRPO 训练的奖励信号,形成一(yī)个(gè)高(gāo)效的自我改进循环。
协(xié)同(tóng)进(jìn)化(huà)机(jī)制(zhì):通(tōng)过(guò)在(zài)同(tóng)一(yī)批(pī)次(cì)中混合处理三类数据,模(mó)型(xíng)的(de)生(shēng)成(chéng)能(néng)力(lì)与(yǔ)评(píng)判(pàn)能(néng)力得以协同进化。生成能力提升带动评判更精准,而精准评判进一步引导生成质量跃升,从而突破静态奖励模型的性能瓶颈。
实验结果显示,基于 Qwen2.5-7B 模型,URPO 框架超越依赖独立奖(jiǎng)励(lì)模(mó)型(xíng)的传统基线:在 AlpacaEval 指令跟随(suí)榜(bǎng)单(dān)上(shàng),得分从 42.24 提升至 44.84;在综合推理能力测试中,平均分从 32.66 提升至 35.66。作为训练的“副产品”,该模型内部自然涌现出的评判能力在 RewardBench 奖励模型评测中取得 85.15 的高分,表现优于其替代的专(zhuān)用(yòng)奖(jiǎng)励(lì)模(mó)型(xíng)(83.55 分)。
从摩尔线程官方获悉,目前(qián),URPO 已(yǐ)在(zài)摩尔线程自研计算卡上实现稳定高效运行。同时,摩尔线程已完成 VERL 等主流强化学习框架的深度适配。
热门新闻
- 1退烧药无效!脱离热环境、物理降温是首选
- 2物联网ETF华泰柏瑞(516330)涨1.50%,半日成交额2.13万元
- 3物联网ETF华夏(516260)涨0.79%,半日成交额105.47万元
- 4物联网ETF易方达(159895)涨1.35%,半日成交额417.19万元
- 5物联网ETF南方(159896)涨1.15%,半日成交额87.89万元
- 6物联网ETF招商(159701)涨1.01%,半日成交额4.52万元
- 7物联网工程专业排名:技术深度与产业协同的双重标尺
- 8浙江省博物馆:向受到影响的观众致歉
- 9吃他汀,一颗花生不能碰?再次提醒:这5种食物也要留意
- 10辽宁联通“物联网+5G专网”融合 助推港口数字化转型
- 11物联网图片:解码数据背后的工业级应用逻辑
- 12高价回收老物件?270多名中老年人被骗!警方提醒
- 13山东省首批博物馆研学旅游线路发布
- 14物联网设计大赛:技术深度与场景落地的双重较量
- 15字节系大幅领先腾讯系!张一鸣移动互联网战略发威
