Kimi K3创纪录成绩的真正原因是什么

Kimi K3 自 7 月 16 日上线以来,相关头条新闻似乎都在暗示中国刚刚超越了美国。该模型拥有 2.8 万亿个参数,是迄今为止权重将对外开放的最大规模模型。 一些观察人士已将其称为下一个“DeepSeek时刻”。
不过,关于该模型最耐人寻味的一句话并未出现在头条新闻中,而是出自Moonshot公司的技术博客。该公司的开发者写道,其整体性能仍落后于最强大的专有模型,即Claude Fable 5和GPT-5.6 Sol。 一家公司推出自家产品却坦言其并非最佳,实属罕见。这也正是为何这些创纪录的数据值得我们深入探究。
关于K3已正式发布且可免费试用的基本消息,我们此前已作报道。本文将探讨后续的发展。
第一名,以及它真正衡量的标准
K3确实在一项重要对比中胜出。在“前端代码竞技场”(Frontend Code Arena)测试中,用户会看到两个并列的结果,并在不知晓生成模型的情况下选择更好的那个,K3在此脱颖而出。 甚至领先于Claude和GPT。
但关键在于:这项测试衡量的是“品味”。用户只是对哪个网页界面更喜欢进行评分。这更多反映了设计水平,而非内容准确性。若有人将此解读为“Kimi击败了美国模型”,那就混淆了偏好排名与准确性测试之间的区别。
为何需要仔细阅读基准测试表
Moonshot 公布了其测试数据,而有趣的部分就在脚注中。根据基准测试的不同,每个模型运行在不同的代理框架下,有时是 KimiCode,有时是 Claude Code,有时是 Codex。这些是不同的起跑条件,并非在同一赛道上进行的公平竞赛。
在一项编码测试中,Moonshot 自己也承认,Claude Fable 5 在 35% 的任务中遇到了回退机制,这可能拖低了其得分。 在另一项测试中,K3 仅在采用将上下文压缩至 30 万令牌的技术时才达到最高分。若不采用这种上下文管理技术,分数便会下降。
独立分析机构 Artificial Analysis 的一项评估结果,充分展示了这些数据是多么容易发生逆转。 该报告显示,Kimi K3在“幻觉”指标上的得分为49%。这听起来像是较低的分数。然而,该指标的计分方式是反向的:它统计的是模型没有出错的频率。 数值越高越好,在同一榜单中,Claude Fable 5 以 45% 的成绩位列 K3 之后,而多个 GPT-5.6 变体则远远落后。
值得牢记的一条规则是:在相信基准测试的头条新闻之前,请先确认具体测量了什么,以及该指标的量表指向何方。
你能自己运行 K3 吗?
对于我们的读者来说,这才是真正的问题。坦率地说:对于普通用户而言,即使权重文件发布后,这也几乎不会带来任何实质性变化。原因很简单——就是文件体积。
不妨简单计算一下。Moonshot 从一开始就采用一种名为 MXFP4 的紧凑数值格式来训练 K3,该格式每个权重约占用 4 位。 权重(也称为参数)是构成人工智能模型的已学习数值。以2.8万亿个参数计算,仅模型文件本身就占用约1.4太字节的空间。不是千兆字节,而是太字节。 作为参考:一个典型的、拥有80亿个参数的模型(即在配置良好的笔记本电脑上运行的那种),大约占用5千兆字节的空间。
Moonshot 本身建议在配备 64 个或更多加速器的超级节点环境中运行 K3。这并非过度谨慎,而是这些规格带来的必然结果。单张配备 96 吉字节显存的专业显卡,其性能差距超过十倍。
因此,“开放权重”并不意味着您可以在家中运行该模型。它的含义是,研究人员、企业和云服务提供商可以下载该模型、对其进行审查,并在自己的基础设施上运行,而无需仅通过 Moonshot 的服务器租用。这固然有价值,但与许多人的想象有所不同。
如果你真的想在自己的机器上不依赖云端运行AI,那么专为此任务构建的小型模型才是正确选择。我们在另一篇文章中已经展示了其工作原理以及硬件需求。
给技术爱好者的一点补充说明:由于K3从一开始就是以这种低精度进行训练的,因此紧凑格式是其原始状态,而非事后压缩而成的模型。关于“精度降低会造成多少质量损失”这一常见问题,在此情况下并不适用。
实际成本
计费以“令牌”(token)为单位,即通常仅包含几个字符的小文本片段。通过 API,Moonshot 对每百万个输入令牌收取 3 美元,对每百万个输出令牌收取 15 美元。重复输入的计费为 30 美分,价格要便宜得多。
这使得 K3 不再具有价格优势。其费用约为其前代产品的三倍,而前代产品的输入费用仅略低于 1 美元。 与定价分别为10美元和50美元的Claude Fable 5相比,K3显然更便宜。不过,Claude Sonnet 5目前以2美元和10美元的优惠价销售,仍比K3更具价格优势,且要到9月才能与K3持平。在Moonshot平台上,中国模型主要依靠价格竞争的时代正在结束。
» Notebookcheck多媒体笔记本电脑Top 10排名
» Notebookcheck游戏笔记本电脑Top 10排名
» Notebookcheck低价办公/商务笔记本电脑Top 10排名
» Notebookcheck高端办公/商务笔记本电脑Top 10排名
» Notebookcheck工作站笔记本电脑Top 10排名
» Notebookcheck亚笔记本电脑Top 10排名
» Notebookcheck超级本产品Top 10排名
» Notebookcheck变形本产品Top 10排名
» Notebookcheck平板电脑Top 10排名
» Notebookcheck智能手机Top 10排名
» Notebookcheck评测过最出色的笔记本电脑屏幕
» Notebookcheck售价500欧元以下笔记本电脑Top 10排名
» Notebookcheck售价300欧元以下笔记本电脑Top 10排名
还有一点很容易被忽略。K3目前始终以最高努力级别进行推理。Moonshot计划稍后添加更精简的模式。这使得答案非常详尽,但也意味着即使是一个简单的问题,也会触发耗费资源的推理过程。 独立测试数据显示,该模型的输出速率约为每秒62个令牌,在速度方面处于中等水平。
您的输入数据会如何处理
对于在应用或网站上尝试使用 K3 的任何人来说,这一部分最为关键。Moonshot 的隐私政策明确指出,输入内容、音频、图像、视频和文件均会被处理以提供和改进服务,其中明确包括其自身模型的训练和优化。
但在该政策中,并未提供专门的开关来关闭基于您内容的训练功能。政策仅提及一般性的数据主体权利,您可通过账户设置或向隐私联系人发送电子邮件来行使这些权利。相比之下,ChatGPT和Claude则直接在设置中提供了相应的开关。
此外,该政策还规定:收集的数据包括 IP 地址、设备标识符、会话 ID 和对话 ID,以及在设备设置允许的情况下,剪贴板中的数据。关于存储位置,该政策仅表示数据可能会被传输到您居住国以外的服务器上,但未指明具体国家。服务提供商为总部位于新加坡的 Moonshot AI PTE. LTD.,总部位于新加坡,该政策日期为2025年7月7日。
对于无害任务的测试运行,这尚可接受。但涉及公司内部数据、客户数据或私人文件时,应遵循与任何云服务相同的规则——只不过此处的服务提供商在其条款中明确规定了数据用于模型训练。
谁能从 Kimi K3 中获益最多
试用完全免费。 有两类用户将获益最多:从事开发或设计工作的人,以及经常处理超长文档的人。K3在代码与视觉元素交汇的领域表现尤为出色,例如网页界面、3D和动画。100万令牌的上下文窗口对于长文本处理极具吸引力,且内置了图像处理功能。
若您追求最佳的答案质量或最流畅的使用体验,美国顶尖模型仍是更优选择。Moonshot 自己也这么说。此外,任何希望尽快在自己的电脑上部署前沿模型的人,都应牢记那 1.4 太字节的存储需求。
K3 最令人惊叹之处不在于其排名,而在于其发展速度。 一家中国公司不仅推出了可与全球顶尖模型媲美的产品,还开放了模型数据。两年前,这简直难以想象。









