AI探索指南 Huggingface 发布 SmolLM3 3B LLM#ai创造营# 性能上超越 Llama-3.2-3B 和 Qwen2.5-3B,同时与更大的 4B 模型 Gemma3 持平 除了开源模型本身外,还开源了使用公共数据集和训练框架训练模型的方法 - 3B 模型在 11T Toekn 上训练 - 具备双模式推理的指令模型 -支持 6 种语言的多语言 - 最长支持 128K 上下文 架构与训练细节 采用 Transformer 解码器架构,基于 Llama 并做了多项优化: Grouped Query…