蚂蚁百灵近日宣布,其自主研发的 Ling-3.0-tiny 轻量级大语言模型正式在 Hugging Face 平台开源。该模型采用混合推理 MoE(Mixture of Experts)架构,总参数规模达 79 亿,但在实际运行中每 Token 仅激活 13 亿参数,显著降低了计算资源消耗。为满足不同硬件环境的部署需求,官方同步发布了 BF16、FP8 和 INT4 三种量化权重版本。
模型架构设计方面,Ling-3.0-tiny 创新性地采用高效混合线性结构,将 KDA(Kimi Delta Attention)与 MLA(Multi-Head Latent Attention)按 3:1 比例交替堆叠。其稀疏 MoE 前馈网络配备 128 个路由专家,在保持 8K 上下文处理能力的同时,将计算成本控制在合理范围内。这种设计使得模型在处理长文本时仍能维持高效运行。
针对本地部署场景,该模型特别优化了响应模式,支持快速交互与复杂推理双模式切换。实测数据显示,在搭载 M4 Pro 芯片的 MacBook 上,模型推理速度可达每秒 86-90 Token,处理 8K 长度文本时峰值内存占用仅约 8.34GiB。研发团队已在英伟达 DGX Spark 服务器、Apple Silicon MacBook 及 Mac mini 等设备完成验证,证明其具备广泛的硬件适配性。











