同 DeepSeek 事件后,又一个中国 AI 模型让美国政界和科技界感到不安。
作者|宇航猿
编辑|靖宇
7 月 22 日当天,发生了几件引人关注的事。
白宫科技政策办公室主任 Michael Kratsios 在社交平台 X 上发文指责月之暗面(Moonshot AI)的 Kimi K3 模型涉嫌「大规模蒸馏」美国技术。
OpenAI 总裁 Greg Brockman 在接受 Bloomberg 采访时坦言 K3「确实表现不错,毋庸置疑」。
几乎同时,近 200 家硅谷初创公司联名上书特朗普政府,提醒禁用中国开源模型可能造成「数百家企业倒闭」。Nvidia 首席执行官黄仁勋则在接受 Axios 专访时指出,美国公司「有必要使用中国 AI 模型」。
不同声音指向同一个源头。
7 月 16 日,中国 AI 企业月之暗面发布了 Kimi K3 模型,成为焦点。
如果说 2025 年初 DeepSeek 引爆的冲击波主要影响了华尔街对 AI 基础设施投资的信心,那么 K3 带来的这一轮冲击,则触及了美国 AI 产业的根本——当中国能以接近前沿水准共享模型权重,美国该如何应对?
Kimi K3 不断进步的性能,仅用一周时间就引起了硅谷和华盛顿的广泛关注。
01
Kimi K3 的特别之处
先说 Kimi K3 模型本身。
拥有 2.8 万亿参数量,采用 MoE(混合专家)架构,每次处理中激活 16 个专家中的 896 个,支持长达 100 万 token 的上下文输入。这是当前全球规模最大的开放权重模型,其完整权重计划于 7 月 27 日向公众开放。
Artificial Analysis 的智能指数显示,K3 得分 57,位列全球第三,仅次于 Anthropic 的 Fable 5(60 分)和 OpenAI 的 GPT-5.6 Sol(59 分),略高于 Claude Opus 4.8(56 分)。模型在代码生成等任务上表现出色,发布 24 小时内即登顶 Arena 排行榜榜首,超越了所有美国前沿模型。
K3 凭借一些创新架构设计脱颖而出。
Kimi Delta Attention(KDA)是一种混合线性注意力机制,能在百万 token 级别的上下文中提升 6.3 倍的解码效率。Attention Residuals(AttnRes)允许每一层从任意层中获取信息,而非传统方式的均匀累加。结合 Stable LatentMoE 和 SFT 阶段的量化感知训练,K3 相较于上一代 K2,整体扩展效率提升约 2.5 倍。
真正让美国方面担忧的,是「性能优越、价格亲民、权重开放」三重优势的结合。
K3 的 API 费用为每百万输出 token 15 美元。在中国同行中这是较高的定价——DeepSeek V4 为 0.87 美元,智谱的 GLM-5.2 为 4.4 美元。
但与 Fable 5 等 US 模型相比,价格不到三分之一。一个技术水平接近前沿的模型,以更低的成本提供服务,且完全开放权重,这三者叠加使得 K3 成为 DeepSeek 之后对美国硅谷影响最大的中国 AI 产品。
这一成绩并非无源之水。
K3 发布前,Kimi 系列模型已悄然进入部分硅谷企业工作流程。
SpaceX 正在动用约 600 亿美元的代码工具 Cursor,其 Composer 2 核心运行在 Kimi K2.5 上。DoorDash 的 CTO Andy Fang 公开表示,部分基础性任务已由 Kimi K2.6 完成。










网友评论