野生DeepSeek火了 速度碾压(官方版) :权?重开源

2025-07-23 18:27:43      来源:中华网

机器之心报道

没等来DeepSeek官方的R2,却迎来了一个速度更快、性能不弱于R1的「野生」变体!

这两天,一个名为「DeepSeekR1T2」的模型火了!

这个模型的速度比R1-0528快200%,比R1快20%。除了速度上的显著优势,它在GPQADiamond(专家级推理能力问答基准)和AIME24(数学推理基准)上的表现均优于R1,但未达到R1-0528的水平。

在技术层面,采用了专家组合(AssemblyofExperts,AoE)技术开发,并融合了DeepSeek官方的V3、R1和R1-0528三大模型。

当然,这个模型也是开源的,遵循MIT协议,并在HuggingFace上开放了权重。

HuggingFace地址:https://huggingface.co/tngtech/DeepSeek-TNG-R1T2-Chimera

经过进一步了解,我们发现:DeepSeekR1T2是德国一家AI咨询公司「TNG」推出的,模型全称为「DeepSeek-TNGR1T2Chimera」(以下简称R1T2)。

该模型除了前文提到的在智力水平和输出效率之间实现完美平衡之外,相较于这家公司的初代模型「R1TChimera」,智力大幅跃升,并实现了突破性的think-token一致性。

不仅如此,即使在没有任何系统提示的情况下,该模型也能表现稳定,提供自然的对话交互体验。

在评论区,有人误以为这个模型出自DeepSeek官方,并且认为他们是不是也在走相同的路线:给模型起各种名称,就是不用主系列下一代版本号?

更多的人认可该模型「找到了智能与输出token长度之间的最佳平衡点,并且提升了速度」,并对该模型在现实世界的表现充满了期待。

模型细节概览

从HuggingFace主页来看,R1T2是一个基于DeepSeekR1-0528、R1以及V3-0324模型构建的AoEChimera模型。

该模型是一个采用DeepSeek-MoETransformer架构的大语言模型,参数规模为671B。

R1T2是该公司4月26日发布的初代模型「R1TChimera」的首个迭代版本。相较于利用双基模型(V3-0324+R1)的初代架构,本次升级到了三心智(Tri-Mind)融合架构,新增基模型R1-0528。

该模型采用AoE技术构建,过程中利用较高精度的直接脑区编辑(directbrainedits)实现。这种精密融合不仅带来全方位提升,更彻底解决了初代R1T的token一致性缺陷。

团队表示,R1T2对比其他模型具备如下优劣:

与DeepSeekR1对比:R1T2有望成为R1的理想替代品,两者几乎可以通用,并且R1T2性能更佳,可直接替换。

与R1-0528对比:如果不需要达到0528级别的最高智能,R1T2相比之下更加经济。

与R1T对比:通常更建议使用R1T2,除非R1T的特定人格是最佳选择、思考token问题不重要,或者极度需求速度。

与DeepSeekV3-0324对比:V3速度更快,如果不太关注智能可以选择V3;但是,如果需要推理能力,R1T2是首选。

此外,R1T2的几点局限性表现在:

R1-0528虽推理耗时更长,但在高难度基准测试中仍优于R1T2;

经SpeechMap.ai(由xlr8harder提供)测评,R1T2应答克制度(reserved)显著高于R1T,但低于R1-0528;

暂不支持函数调用:受R1基模型影响,现阶段不推荐函数调用密集型场景(后续版本可能修复);

基准测试变更说明:开发版由AIME24+MT-Bench变更为AIME24/25+GPQA-Diamond测评体系,新体系下R1与初代R1T的分差较早期公布数据更大。

最后,关于R1T2中重要的AoE技术,可以参考以下论文。

论文标题:AssemblyofExperts:Linear-timeconstructionoftheChimeraLLMvariantswithemergentandadaptablebehaviors

  以西安咸阳机场为例,扩建后拥有4座航站楼,航站楼面积高居国内前5。但西安咸阳机场去年旅客吞吐量排在全国第11位,西安去年GDP仅排在全国第21位。

责编:谢芳如编辑

外交部呼吁立即停火止战

  经查,王一新丧失理想信念,背弃初心使命,结交政治骗子,对抗组织审查;违背组织原则,隐瞒不报家庭房产情况,在组织谈话时不如实说明问题,违规选拔任用干部并收受财物;违规收受礼金,接受私营企业主低价装修,利用职权为特定关系人谋取利益,搞权色、钱色交易;道德败坏;以权谋私,大搞权钱交易,利用职务便利为他人在土地开发、项目承揽等方面谋利,并非法收受巨额财物。

北大浙大隐藏升学通道

  因此在不断强化税收征管的同时,应该同步适度推进税制改革,适度降低名义税率,让企业实际税负维持在一个合理水平,同时国家财政收入也并不会由此减少,进而实现良性循环。

伊朗开始逐步亮出杀手锏

  6月13日、14日,河南多地发布人工增雨公告。提醒:任何组织和个人若发现未爆炸或爆炸不完全弹头、弹药碎片或火箭弹残骸,切勿擅自移动、藏匿、拆解和损毁等,请立即报告当地政府或人工影响天气有关部门,或者立即拨打110向当地公安部门报警。

这么带感的恶女七根心简有个

  经查,王一新丧失理想信念,背弃初心使命,结交政治骗子,对抗组织审查;违背组织原则,隐瞒不报家庭房产情况,在组织谈话时不如实说明问题,违规选拔任用干部并收受财物;违规收受礼金,接受私营企业主低价装修,利用职权为特定关系人谋取利益,搞权色、钱色交易;道德败坏;以权谋私,大搞权钱交易,利用职务便利为他人在土地开发、项目承揽等方面谋利,并非法收受巨额财物。

组数据看中欧班列亮眼成绩单

  6月13日9时,国家防总针对广西、福建启动防汛四级应急响应,派出两个工作组分赴广西、福建协助指导;新增针对河北、内蒙古启动抗旱四级应急响应,并继续维持针对河南、山东的抗旱四级应急响应,两个工作组正在两省协助指导。

伊朗对以发动大规模袭击

  去年,民航局、国家发改委联合发文《关于推进国际航空枢纽建设的指导意见》,画出国际航空枢纽的蓝图,提出“3+7+N”国际航空枢纽功能体系。/p>

张继科说没价值的原因找到了

  经查,陈玉祥丧失理想信念,背弃初心使命,执纪违纪,执法犯法,罔顾中央八项规定精神,热衷于吃喝享乐,长期频繁接受宴请,违规接受旅游、健身等活动安排;无视组织原则,在干部选拔任用中为他人谋取利益并收受财物;违规收受礼品、礼金;违反工作要求,干预和插手司法及执纪执法活动;甘于被“围猎”,把组织赋予的权力当作谋取私利的工具,大搞权钱交易,利用职务便利为他人在企业经营、项目运营等方面谋利,并非法收受巨额财物。/p>

邵雨轩谈疯产姐妹解散原因

  中央要求谋划新一轮财税改革,税制改革是重头戏,未来增值税、消费税、个税等主要税种还将有进一步改革举措。笔者呼吁,在税收征管不断强化的同时,为促进企业、个人实际税负维持在合理水平,未来税制改革应当统筹考虑降低名义税率。