蚂蚁百灵开源 Ling-3.0-tiny 模型,支持英伟达 DGX Spark、苹果 Mac mini 部署
IT之家 8 月 11 日消息,蚂蚁百灵今天在 Hugging Face 平台开源了 Ling-3.0-tiny 模型。这款模型是轻量级混合推理 MoE 架构,总参数为 7.9B,每个 Token 激活 1.3B 参数。官方提供了 BF16、FP8 和 INT4 权重版本,以适应不同平台的部署需求。

据介绍,Ling-3.0-tiny 主要聚焦于低成本推理,采用高效的混合线性架构,KDA(Kimi Delta Attention)和 MLA(Multi-Head Latent Attention,多头潜在注意力)的比例为 3:1 交替堆叠。该模型使用包含 128 个路由专家(routed experts)的稀疏 MoE 前馈网络(FFN),在上下文处理能力与计算成本之间取得了良好的平衡。
IT之家注意到,该模型支持快速响应模式和多步骤推理模式,专为本地部署设计。**官方已在英伟达 DGX Spark、Apple Silicon MacBook 和 Mac mini 等电脑上进行了验证**。在 M4 Pro 的 MacBook 上,推理速度可达到约 86-90 Token/s,8K 的上下文长度下,峰值内存占用大约为 8.34 GiB。
参考:
- [inclusionAI/Ling-3.0-tiny · Hugging Face](https://huggingface.co/inclusionAI/Ling-3.0-tiny)
---
原文链接:[点击查看](https://www.ithome.com/0/988/431.htm)

据介绍,Ling-3.0-tiny 主要聚焦于低成本推理,采用高效的混合线性架构,KDA(Kimi Delta Attention)和 MLA(Multi-Head Latent Attention,多头潜在注意力)的比例为 3:1 交替堆叠。该模型使用包含 128 个路由专家(routed experts)的稀疏 MoE 前馈网络(FFN),在上下文处理能力与计算成本之间取得了良好的平衡。
IT之家注意到,该模型支持快速响应模式和多步骤推理模式,专为本地部署设计。**官方已在英伟达 DGX Spark、Apple Silicon MacBook 和 Mac mini 等电脑上进行了验证**。在 M4 Pro 的 MacBook 上,推理速度可达到约 86-90 Token/s,8K 的上下文长度下,峰值内存占用大约为 8.34 GiB。
参考:
- [inclusionAI/Ling-3.0-tiny · Hugging Face](https://huggingface.co/inclusionAI/Ling-3.0-tiny)
---
原文链接:[点击查看](https://www.ithome.com/0/988/431.htm)
评论
暂无评论。