数据世界
产业资讯 宏观经济 企业动态 人物动态 科技数码 数据洞察 AI前沿 行业峰会 热点资讯

Kimi K3开放权重引热议:技术全景能否澄清蒸馏Claude的争议?

2026-07-30来源:快讯编辑:瑞雪

7月27日晚,月之暗面举办Kimi K3开放日活动,正式发布K3模型权重及技术报告,同时开源三项关键基础设施:面向超大规模混合专家模型(MoE)通信的MoonEP、针对线性注意力优化的FlashKDA,以及支持长周期智能体强化学习的AgentEnv。此次开放引发行业对K3技术突破路径的广泛讨论,尤其是其能力提升是否源于对竞品模型的“工业级蒸馏”。

K3采用混合专家架构,总参数规模达2.8万亿,实际激活参数约1042亿。通过896个路由专家与2个共享专家的组合设计,其单次计算调用的参数量较前代K2增长两倍以上。技术团队通过重构注意力机制,将原生上下文窗口扩展至百万Token级别,同时引入注意力残差结构解决深层模型的信息稀释问题。Stable LatentMoE技术则通过动态专家调度,在保持模型知识容量的同时降低计算开销,整体扩展效率较K2提升约2.5倍。

行业分析指出,K3的技术突破不仅体现在参数规模扩张,更在于底层架构的创新。例如,Kimi Delta Attention与Gated MLA的混合设计平衡了长上下文处理效率与全局信息交互需求;MoonEP通信框架解决了超大规模MoE训练中的专家负载均衡难题;FlashKDA则通过优化GPU内存管理,使线性注意力机制得以高效运行。这些技术共同支撑起K3在编程、智能体等复杂任务上的表现跃升。

针对外界质疑的“蒸馏Claude”问题,技术报告披露了K3的后训练流程:先通过监督微调建立基础模型,再在通用任务、通用智能体、编程智能体三个方向进行强化学习,每个方向设置低、中、高三级推理强度,形成九个专业教师策略。最终通过多教师在线策略蒸馏(MOPD)技术,将九套策略整合为统一模型。报告强调,MOPD阶段的教师模型均基于K3冷启动模型训练,未直接使用外部模型输出。

此前,Anthropic及美国官员曾指控月之暗面通过虚假账户获取Claude输出数据,涉及超340万次交互。中国商务部回应称,美方指控缺乏证据支撑,且模型蒸馏为行业通用技术。有行业人士指出,Fable 5公开发布与K3上线时间间隔较短,若完全依赖外部模型输出完成训练,不符合超大模型研发周期规律。目前,昇腾等硬件厂商已宣布完成对K3的适配优化,但社区尚未独立复现其宣称的扩展效率与任务吞吐能力。

华为鸿蒙电脑生态应用超19000款,全面覆盖多核心场景且品牌力攀升
据介绍,鸿蒙电脑生态应用全面覆盖办公、娱乐、创作、游戏等核心场景。 IT之家从沟通会现场了解到,华为 PC 品牌力也再创新高:2026 年 6月,华为笔记本电脑认知度达到 94%;2026 年 6 月,华…

2026-07-30

OPPO新机配置曝光:8000mAh大电池+80W快充,或为A7 Pro机型
IT之家 7 月 29 日消息,博主 @熊猫很禿然 发文,曝光了隶属 OPPO A7 系列产品线的新机,该机整体重量 204g、厚度8.8mm,正面将配备一块 6.57 英寸 1080P 直屏(预计为 OL…

2026-07-30

华为9月双箭齐发!三折叠新机与Mate 90系列同台,高端市场激战将至
目前市场上能量产三折叠手机的厂商仅有华为与三星,而三星暂无9月发布新品的计划,由此确认,华为新一代三折叠新机与Mate90系列,将集中在9月登场,恰逢苹果秋季新品发布会周期,两大高端品牌将迎来正面交锋。 …

2026-07-30

麒麟XE90处理器首发!华为MateBook Pro S登场,798g重量刷新轻薄本新高度
配合超丝滑方舟引擎,MateBook Pro S在办公与创作场景中实现效率跃升:WPS Office大文件打开速度提升30%;悟空图像图像处理速度提升25%;剪映专业版视频剪辑速度提升23%。在热界面材料的…

2026-07-30

Agnes国内API节点上线 2.5系列定位明晰 抢位多模态AI新赛道
同一时间,API访问入口完成换挡,Agnes 2.5 Pro Alpha杀入Artificial Analysis综合能力榜单前列,2.5Flash继续不限期免费开放。 Agnes 2.5 Flash面向…

2026-07-30

华为发布两款全新麒麟CPU!最轻笔记本MateBook Pro S首发 能效性能双提升
在今天的鸿蒙电脑新品技术沟通会上,华为正式公布了两款全新的处理器,分别是麒麟X90 Plus和麒麟XE90。接下来看看今天公布的两款全新笔记本,华为MateBook Pro S首发搭载麒麟XE90,整机重…

2026-07-30