蚂蚁百灵开源Ling-3.0 tiny flash Base模型

发布时间:2026-08-21 10:51

  注:Base 模型通常是指未经特定任务微调的基础预训练模型,在训练过程中最初被开发和优化的,它旨在平衡性能和资源消耗。

  官方表示,这些 checkpoints 适合用于持续预训练、领域监督微调、偏好优化、强化学习后训练、蒸馏,以及长上下文和 MoE 系统研究。

  需要特别说明的是,Base Model 并不是已经完成指令对齐的聊天模型。我们不建议未经后训练便直接将其部署为面向终端用户的聊天服务,也不建议未经额外对齐和评估便用于安全关键型应用。任何生产使用都应完成面向具体任务的后训练、评估与验证。

  在中期训练结束后,官方将传统学习率衰减改写为 checkpoints 加权合并,即 WSM。由于没有了学习率衰减,该 Base Model 更适合持续预训练和动态扩展数据,且支持训练后离线探索不同学习率“衰减曲线”。

  其中,Ling-3.0-tiny-base以相比前代 50% 左右的总参数量,在大多数评测中取得更高结果;在与同等规模模型对比中,展现出更具竞争力的代码能力。

  Ling-3.0-flash-base具备更充足的参数容量与稀疏激活设计,为研究者和开发团队提供了一个可继续训练、拓展并适配真实场景的开放底座。

  在下表的评测中,模型在代码、复杂推理和长上下文方向表现突出。相比总参数量约为其 2–3 倍的 base model,模型的整体表现仍具优势。

排行

精选