我们推出了 Hunyuan-A13B,这是一款基于 Mixture‑of‑Experts(MoE)架构的开源大语言模型。模型总参数量为 80 B,但在推理时仅激活约 13 B 参数,实现了能力、计算效率和部署成本的平衡。
模型在严格过滤的 20 T token 语料上进行预训练,特别加强了 STEM(科学、技术、工程、数学)数据的筛选与组织,从而提升了事实可靠性和推理能力。随后通过高质量的监督微调和大规模强化学习进一步提升整体性能。
Hunyuan-A13B 还引入了双模态 Chain‑of‑Thought 框架,根据任务复杂度动态选择推理深度:对常规查询采用快速思考模式,对复杂多步问题采用慢速思考模式,以兼顾速度与准确性。
在数学、科学、编程、通用语言理解以及智能体任务等多项基准上,模型表现与更大规模的模型相当,甚至在部分任务上接近领先水平。高推理吞吐量使其适用于对时延敏感的应用场景。
我们公开发布 Hunyuan‑A13B,旨在支持开放研究和实际 LLM 部署。
点评