据《每日经济新闻》报道,针对外界流传的“K3是蒸馏小模型”的猜测,月之暗面公司企业业务负责人黄震昕在接受媒体记者采访时直接否认。黄震昕表示,K3性能跃升的核心来自底层原创架构创新,并非对现有模型蒸馏复刻。
PChome 7月22日消息,据《每日经济新闻》报道,针对外界流传的“K3是蒸馏小模型”的猜测,月之暗面公司企业业务负责人黄震昕在接受媒体记者采访时直接否认。黄震昕表示,K3性能跃升的核心来自底层原创架构创新,并非对现有模型蒸馏复刻。

此前发布时,Kimi也提到架构层面变化带来的效率提升。据介绍,Kimi K3基于Kimi Delta Attention(KDA)混合线性注意力机制和Attention Residuals(AttnRes)注意力残差技术构建。MoE(混合专家)层面,模型在896个专家中激活16个。而上述结构性改进让Kimi K3相比K2的整体扩展效率提升约2.5倍。

黄震昕同时也在采访中进一步披露了支撑K3的三项关键技术。其中,Moon Clip是一种全新二阶优化器,由Kimi首次应用于大模型训练。“当前全球可用训练数据基本见底,这项技术能让20T训练数据跑出40T的训练效果,同等性能下训练成本、算力功耗直接减半。”Kimi Linear Tension是其自研线性注意力机制,用于解决传统线性注意力处理超长任务时性能衰减的痛点。“行业存在AI摩尔定律,AI可执行任务时长每7个月翻1倍;这套机制让上下文窗口扩大10倍,训练成本仅同步扩大10倍。”