Kimi K3 发布 47 页技术报告,最有价值的创新点是这些
文章摘要
Kimi K3 发布了具备 2.8T 总参数、104B 激活参数以及 100 万 token 上下文的大模型,其核心技术致力于解决模型规模扩大、上下文延长及智能体长时间工作所带来的架构与训练系统瓶颈。Kimi K3 的技术主线是将随规模膨胀的计算和状态改造成可压缩、可调度、可暂停和恢复的结构。
在架构设计方面,Kimi K3 进行了三项核心创新以应对序列、深度和宽度的扩展挑战。KDA 通过固定大小的递归状态压缩序列历史,AttnRes 允许网络对不同深度的表示进行加权选择以重新调用深度信息,而 Stable LatentMoE 则通过降维计算和量化平衡机制压缩专家通信并优化设备负载。这些设计在控制显存和通信成本的同时,有效支撑了更大的模型容量。
针对智能体长程执行能力,Kimi K3 引入了异步强化学习与基于微虚拟机的环境,支持长任务的暂停、恢复与快照,使持续数小时的真实任务能够顺利进入训练。结合从零训练的原生多模态视觉编码器,智能体能够观察代码运行的真实视觉结果并形成反馈闭环,从而在复杂的底层代码优化等长程任务中持续积累有效改进并刷新性能记录。
在扩展效率与综合表现上,Kimi K3 实现了约 2.5 倍的整体扩展效率提升,已进入当前大模型第一梯队,在编程、搜索及长程工具调用等复杂工作流中表现优异。其核心价值在于将架构、训练和智能体基础设施连接成一套完整系统,使模型在连续工作数小时的过程中,能够保存执行现场、观察实际结果并持续修正错误以完成复杂任务。
原文和模型
【原文链接】 阅读原文 [ 4640字 | 19分钟 ]
【原文作者】 AI科技评论
【摘要模型】 qwen3.7-max-2026-06-08
【摘要评分】 ★★★★★
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



