一句话说明
介绍Kimi K3,一个2.8T参数的混合专家模型,具备原生视觉和百万token上下文。
内容摘要
Kimi K3是2.8T参数混合专家模型,激活104B参数,基于Kimi Delta Attention和Attention Residuals改进信息流,结合Stable LatentMoE技术,整体扩展效率较Kimi K2提升约2.5倍。后训练使用强化学习,在通用、智能体和编程领域表现优异,在长时编程、智能体、知识、推理和视觉任务上达到前沿水平,但仍落后于最强的专有模型。已发布完整权重。