北大杨仝团队发布FairyR1模型:5%参数量数学和代码能力超越满血DeepSeek

北京大学杨仝教授团队近期发布了其在高效大型语言模型研究方向的一项新成果——FairyR1-32B模型。该模型基于DeepSeek-R1-Distill-Qwen-32B基座,通过结合微调与模型合并技术构建。研究探索了在参数量大幅减少的情况下,模型在特定任务上实现与更大模型相当甚至更优性能的可能性。该研究得到了国家自然科学基金委项目(624B2005, 62372009)的资助。FairyR1-32B模型已在huggingface开源:https://huggingface.co/PKU-DS-LAB/FairyR1-32B。

FairyR1-32B模型是在团队前期TinyR1工作基础上进行的进一步探索,沿用了“分合蒸馏”的研究思路,提出了多种改进方法,包括自我合并、多教师交叉蒸馏、轻蒸馏等方法,并在数据处理进行了优化,模型精度有了显著提升。

本次工作重点改进了蒸馏数据的构建流程,对来源于AI-MO/NuminaMath-1.5(数学)和open-thoughts/OpenThoughts-114k(代码)等数据集的原始数据,通过多个“教师模型”生成答案,随后对问答数据进行精心筛选、结构调整与思维链优化,并进行多阶段筛选。筛选过程包括基于答案的正确性验证(针对数学数据),以及基于长度的筛选(数学数据保留2k-8k tokens范围,代码数据保留4k-8k tokens范围),最终构建了更具针对性的约6.6k条数学数据和约3.8k条代码数据用于训练。

在模型结构方面,研究团队尝试训练两个领域(数学和代码)的专业模型进行合并,旨在进一步优化流程和资源消耗。这两个专业模型在一致的训练参数下(例如相同的学习率和批次大小)独立训练约5个周期后,利用AcreeFusion工具进行了合并。在多个公开基准测试中,FairyR1展现出了在低参数量下的竞争力表现。以下为FairyR1与DeepSeek-R1-671B及DeepSeek-R1-Distill-Qwen-32B在部分基准上的得分对比:

北大杨仝团队发布FairyR1模型:5%参数量数学和代码能力超越满血DeepSeek

从测试结果可以看出,FairyR1-32B在AIME 2025和LiveCodeBench基准上得分略高于DeepSeek-R1-671B,在AIME 2024上表现接近。在GPQA-Diamond科学基准上,FairyR1的得分低于DeepSeek-R1-671B。这些结果表明,FairyR1在采用DeepSeek-R1-Distill-Qwen-32B基座并经过特定技术处理后,能够在约5%参数量的情况下,在数理和编程等领域实现与大型模型相当或略优的性能水平,但在科学等其他领域可能存在差距。这项工作探索了通过优化的数据处理和模型融合技术,在保证特定任务性能的前提下,大幅降低模型规模和潜在推理成本的可能性。

北京大学杨仝教授团队表示:“FairyR1-32B模型是我们探索高效大型语言模型技术路线的阶段性成果。通过对蒸馏和合并方法的改进,我们初步验证了在有限资源下实现高性能模型的可行性。”

团队成员:李旺、周俊廷、刘文睿、姚一伦、王融乐、杨仝

北大杨仝团队发布FairyR1模型:5%参数量数学和代码能力超越满血DeepSeek

【来源:经济界】凡本网注明“来源:经济界” 的所有作品,版权均属于经济界。如转载,须注明“来源:经济界”。违反上述声明者,本网将追究其相关法律责任。
Previous 2025-04-24 下午9:29
Next 2025-06-03 上午10:13

相关推荐

  • 10大AI制作微课工具推荐,2025最新榜单,课件帮领先!

    2025 年,AI 制作微课工具迎来了爆发式发展,为方便用户选择,最新榜单出炉,10 大工具各有特色,其中课件帮凭借全面的功能和出色的表现处于领先地位。     课件帮位居榜首,是当之无愧的领先者。它的三大创作模式为微课制作提供了极大便利,文档播讲模式可直接上传 PPT,自动生成口播稿、配置动画转场和字幕(可配置双语字幕),让静态 PPT…

    2025-09-01
    0
  • 北大团队提出2比特复数模型iFairy{±1, ±i},精度反超量化前,可手机部署

    version 8.14 摘要:为破解大模型部署与推理成本高昂的困境,北京大学杨仝老师团队首次提出名为iFairy的超低比特量化方案。该方案创新性地利用复数{±1, ±i}对模型权重进行2-bit量化,在实现1/8极致压缩与“无乘法”推理加速的同时,语言建模能力和下游任务表现甚至反超了其全精度的LLaMA基座模型。 当下,大语言模型(LLM)的研究热潮席卷全…

    2025-08-15
    0
  • 法狗狗智能法律助手斩获WAIC实践价值引领奖!

    7月28日,2025世界人工智能大会(WAIC)在上海圆满闭幕。同日,由上海市司法局主办、上海法律科技协会承办的“法律科技创新应用生态论坛”在世博展览馆隆重举行。 本次论坛以 “智领法律 创见未来” 为主题,汇聚法律界、科技界、学术界及企业界的数百名专家,共同探讨人工智能与法律行业的深度融合与创新发展。 在备受瞩目的 2025法律科技产品大赛 中,法狗狗科技…

    2025-07-29
    0
  • 用友YonSuite医药解决方案合规提效,全链智变,重塑医药新生态!

    当前医药和医疗器械行业正面临政策与市场的双重变革: 国内外宏观政策的持续调整与市场环境的快速演变,对企业的管理水平提升和经营效率优化提出了更为迫切的要求。 与此同时,全球范围内的研发竞争日趋白热化,监管标准也在不断升级,这双重压力倒逼着企业必须借助数智化手段,实现质量管控的全面升级与运营效率的突破性提升。 在这样的背景下,数智化已不再是企业发展的可选项,而是…

    2025-07-21
    0
  • 全省标杆!天正上榜浙江管理现代化企业

    农业农村部发布的机收进度显示,截至6月18日,全国小麦收获进度已达到96%,总体进度高效,推进速度比常年快2到3天。三夏“快跑”的背后,离不开科技的强力支撑。央视、人民日报等央媒聚焦雷沃智慧农业整体解决方案,对潍柴雷沃引领三夏 “智变”的龙头作为进行系列深度报道。 央视频全景直播走进雷沃智慧农场 深度揭秘科学种田的“中国答案” 6月16日,央视频以“1小时4…

    2025-06-23
    0