Kimi K3
已在 cPilot Runtime 上完成 Day-0 端到端适配,Linux x86-64 二进制预览正在打包。
官方模型页 ↗公开二进制研究预览
K3 Flight 通过 CPU-only 本地推理路径运行 Kimi K3,维护者参考实测运行内存约 55GB。
不是压缩。 checkpoint 仍在存储中。约 55GB 是维护者初步实测运行工作集,不是对所有硬件的最低内存承诺。
01 / 实测结果
checkpoint 大小描述模型在存储中的体积;运行内存描述设备在某个时刻需要承载的内容。两者相关,但不是同一个指标。
这不是蒸馏小模型,也不是把 929GB 变成 55GB。K3 Flight 让完整 Q2_K checkpoint 保留在本地存储中,由 cPilot Runtime 管理当前执行窗口。
重点是证明“能运行”,不是争夺数据中心吞吐纪录。
公开演示只会使用与数据相同的 Release 二进制录制。真实素材完成前,网站不会放置模拟终端画面。
| 模型 | Kimi K3 Q2_K |
|---|---|
| 总参数量 | 2.8T |
| 模型文件 | ~929GB |
| 后端 | CPU-only |
| 运行内存 | ~55GB |
| Prefill | ~1 token/s |
| Decode | ~0.8 token/s |
本次预览暂未公开具体 CPU 和 SSD 型号。CPU 能力、本地存储带宽、上下文长度、提示形态与运行时版本都会影响结果。约 55GB 是实测数据,不是最低内存保证。
02 / 飞行路径
Kimi K3 每个 token 从 896 个专家中激活 16 个。cPilot Runtime 把模型稀疏性转化为存储、内存与 CPU 之间受管理的执行路径。
选择阶段,查看我们公开到哪一层。
约 929GB 的 Kimi K3 Q2_K checkpoint 完整保留在本地存储中,并未被压缩成运行内存数字。
[闭源]精确放置决策、缓存规则、预测方法、权重布局、内存阈值、调度策略和优化算子保持闭源。
03 / 模型跑道
K3 Flight 是 cPilot Runtime 的公开验证窗口。未来模型卡片只描述适配路线图,不代表已经支持、确定交付或官方合作。
已在 cPilot Runtime 上完成 Day-0 端到端适配,Linux x86-64 二进制预览正在打包。
官方模型页 ↗已列入适配计划。性能、内存要求与发布时间只会在实机验证后公布。
官方发布说明 ↗已列入适配计划。对外数据将在目标 Release 完成可复现运行后公布。
官方模型页 ↗进入规划跑道,等待可公开下载的权重;这不代表当前已经支持或确认交付日期。
关注后续更新 ↗各模型名称及相关权利归各自权利人所有。K3 Flight、cPilot Runtime 与 ONE-TOKEN 与 Moonshot AI、DeepSeek、Z.ai、阿里巴巴/Qwen 不存在隶属、赞助或官方背书关系。
04 / 社区硬件地图
首行是维护者参考结果。后续社区成功、慢速运行与可控失败,都将进入公开硬件矩阵。
| 来源 | 内存 | 后端 | Prefill | Decode |
|---|---|---|---|---|
| 维护者参考运行 | ~55GB | CPU-only | ~1 tok/s | ~0.8 tok/s |
05 / 起飞前必读
没有。模型文件仍然约为 929GB,并保留在存储中。约 55GB 是维护者参考运行观察到的运行内存。
不是。参考运行使用完整的 Kimi K3 Q2_K checkpoint。Q2_K 是量化表示,与原始高精度 checkpoint 不完全数值等价。
Kimi K3 每个 token 从 896 个专家中激活 16 个。cPilot Runtime 管理当前执行窗口,不要求整个 checkpoint 同时常驻内存。
不是。这只是一次初步实测。预览版建议至少 64GB 系统内存,实际结果会受到 CPU、SSD、上下文与运行时版本显著影响。
不公开。仓库发布可运行的二进制研究预览、文档、校验值与社区实测;推理引擎实现保持闭源。
不会。模型需要独立下载,并继续受 Kimi K3 License 约束;K3 Flight 二进制有单独许可。
关注后续可复现 Linux 预览、真实演示、新模型适配和不断扩大的社区硬件地图。