北大杨仝团队发布FairyR1模型:5%参数量数学和代码能力超越满血DeepSeek

北京大学杨仝教授团队近期发布了其在高效大型语言模型研究方向的一项新成果——FairyR1-32B模型。该模型基于DeepSeek-R1-Distill-Qwen-32B基座,通过结合微调与模型合并技术构建。研究探索了在参数量大幅减少的情况下,模型在特定任务上实现与更大模型相当甚至更优性能的可能性。该研究得到了国家自然科学基金委项目(624B2005, 62372009)的资助。FairyR1-32B模型已在huggingface开源:https://huggingface.co/PKU-DS-LAB/FairyR1-32B。

FairyR1-32B模型是在团队前期TinyR1工作基础上进行的进一步探索,沿用了“分合蒸馏”的研究思路,提出了多种改进方法,包括自我合并、多教师交叉蒸馏、轻蒸馏等方法,并在数据处理进行了优化,模型精度有了显著提升。

本次工作重点改进了蒸馏数据的构建流程,对来源于AI-MO/NuminaMath-1.5(数学)和open-thoughts/OpenThoughts-114k(代码)等数据集的原始数据,通过多个“教师模型”生成答案,随后对问答数据进行精心筛选、结构调整与思维链优化,并进行多阶段筛选。筛选过程包括基于答案的正确性验证(针对数学数据),以及基于长度的筛选(数学数据保留2k-8k tokens范围,代码数据保留4k-8k tokens范围),最终构建了更具针对性的约6.6k条数学数据和约3.8k条代码数据用于训练。

在模型结构方面,研究团队尝试训练两个领域(数学和代码)的专业模型进行合并,旨在进一步优化流程和资源消耗。这两个专业模型在一致的训练参数下(例如相同的学习率和批次大小)独立训练约5个周期后,利用AcreeFusion工具进行了合并。在多个公开基准测试中,FairyR1展现出了在低参数量下的竞争力表现。以下为FairyR1与DeepSeek-R1-671B及DeepSeek-R1-Distill-Qwen-32B在部分基准上的得分对比:

北大杨仝团队发布FairyR1模型:5%参数量数学和代码能力超越满血DeepSeek

从测试结果可以看出,FairyR1-32B在AIME 2025和LiveCodeBench基准上得分略高于DeepSeek-R1-671B,在AIME 2024上表现接近。在GPQA-Diamond科学基准上,FairyR1的得分低于DeepSeek-R1-671B。这些结果表明,FairyR1在采用DeepSeek-R1-Distill-Qwen-32B基座并经过特定技术处理后,能够在约5%参数量的情况下,在数理和编程等领域实现与大型模型相当或略优的性能水平,但在科学等其他领域可能存在差距。这项工作探索了通过优化的数据处理和模型融合技术,在保证特定任务性能的前提下,大幅降低模型规模和潜在推理成本的可能性。

北京大学杨仝教授团队表示:“FairyR1-32B模型是我们探索高效大型语言模型技术路线的阶段性成果。通过对蒸馏和合并方法的改进,我们初步验证了在有限资源下实现高性能模型的可行性。”

团队成员:李旺、周俊廷、刘文睿、姚一伦、王融乐、杨仝

北大杨仝团队发布FairyR1模型:5%参数量数学和代码能力超越满血DeepSeek

【来源:经济界】凡本网注明“来源:经济界” 的所有作品,版权均属于经济界。如转载,须注明“来源:经济界”。违反上述声明者,本网将追究其相关法律责任。
Previous 2025-04-24 下午9:29
Next 3天前

相关推荐

  • 2025全球人工智能技术创新大赛——硬件创新挑战赛即将开赛

    近日,备受瞩目的2025全球人工智能技术创新大赛——硬件创新挑战赛进入开赛倒计时,将于2025年6月5日至6日在杭州市余杭区未来科技城国际会议中心盛大举行。 本次大赛由中国人工智能学会主办,北京塔洛斯科技有限公司及北京心引力科技有限公司协办,旨在挖掘并培育人工智能硬件领域的创新力量,推动人工智能技术实现跨越式发展。 本次大赛比赛地点为杭州未来科技城国际会议中…

    3天前
    0
  • 凝心聚力 开拓新局|山东三聚20万吨/年生物柴油异构项目成功中交

    4月23日上午,北京海新能源科技股份有限公司(以下简称海新能科)旗下山东三聚生物能源有限公司(以下简称山东三聚)举行20万吨/年生物柴油异构项目中交仪式,标志着该项目由建设阶段正式转入试生产阶段,将成为海新能科厚积产业优势,打造生物能源板块高质量发展的新引擎。 在仪式现场,山东省日照市莒县人民政府党组副书记、县经济开发区党工委副书记、管委会主任尹进华,莒县国…

    2025-04-24
    0
  • 竞域无界——LG电子携 IT产品邀您畅游AWE新竞界

    2025  AWE(中国家电及消费电子博览会),LG 电子带来了一场精彩纷呈的 IT 产品盛宴。此次 LG 展区围绕不同群体的家庭生活方式精心布局,通过智玩空间、智趣之家、乐宠之家和臻享之家等特色展区,全方位展示了其 IT 产品的独特魅力和创新科技。 智玩空间(Immersive Lounge):2.0 版本开启 MZ 圈层的黑科技之旅 智玩空间展区作为去年…

    2025-03-21
    0
  • 联通云盘亮相MWC 2025:融云融智,让存储充满“AI”

    DeepSeek爆火,再度掀起人工智能(AI)热浪。云存储领域,也面临AI推动的深刻变革。 当地时间3月3日至3月6日,2025年世界移动通信大会(MWC,也称“巴展”)在巴塞罗那会展中心举行。全球数百个国家和地区的知名企业、行业领袖将齐聚于此,展示全球最新的数字技术,擘画通信与智能融合发展的新蓝图。中国联通以“聚智·融合·创新”为主题,聚焦全球数字化、网络…

    2025-03-06
    0
  • 深圳回波医疗立足本土化需求 开发FibroScan® Q-PLUS型号肝病检测设备

    在全球肝病负担日益加重的背景下,中国作为肝病高发国家,乙肝、脂肪肝等慢性肝病患者数量庞大。慢性肝病通常是一种沉默的疾病,往往在早期没有明显症状,但一旦疾病进展,它可能会危及生命。在达到肝硬化阶段的患者中,75% 的患者直到经历第一次失代偿事件才被诊断出来1。目前晚期肝病市场痛点显著,诊断上,传统方法难精准评估,肝穿活检又有风险,难以满足基层医疗机构的筛查需求…

    2025-02-25
    0