Kimi K3 在 M1 Max 上跑起来了:0.3 tok/s 但路径打通了

lxiol

2.8 万亿参数的「庞然大物」跑在家用电脑上

Kimi K3 是一个拥有 2.8 万亿参数、以 MXFP4 格式量化后仍占用约 1.4TB 存储的巨量模型。按常理,这种规模的模型只能在数据中心里用多张 H100 才能跑起来。但 gavamedia 做了一个大胆的尝试:在一台只有 64GB 内存的 M1 Max MacBook Pro 上,通过 SSD 流式加载(SSD streaming) 技术,成功运行了 Kimi K3——推理速度仅为 0.3 tok/s,但这条路是通的。这是首次公开验证了在消费级硬件上运行中国前沿大模型的可行路径。

SSD Streaming:以空间换可行的技术路线

0.3 tok/s 看起来慢得可笑,但背后的技术意义远超速度本身。M1 Max 的统一内存仅 64GB,而模型需要 1.4TB,差距超过 20 倍。SSD streaming 的核心思路是:将模型权重存储在高速 SSD 上,每次推理时按需将所需部分加载到内存,用完即丢弃,循环往复。这与传统推理的”全部加载到显存”模式截然不同,本质上是用 I/O 带宽换取内存容量。M1 Max 的 SSD 读取速度约 7GB/s,这也是 0.3 tok/s 的理论瓶颈所在。

从 M1 Max 到 M5 Max:硬件进化释放潜力

Redis 创始人 antirez 随后在 M5 Max 上使用 DwarfStar 引擎 进行了 Kimi K3 的本地推理演示,性能有了显著提升。更重要的是,antirez 提出了一个有趣的计算:两台 Mac Studio 512GB 版本联合使用,通过某种分布式推理方案,或许能达到实际可用的推理速度。这揭示了一个趋势:随着 Apple Silicon 统一内存架构的持续进化(M5 Max 已支持高达 512GB 统一内存),本地运行超大模型的硬件门槛正在快速降低。

路线打通的意义

这次实验的意义不在于速度,而在于证明了路径存在。它回答了社区长久以来的一个问题:”中国最顶尖的 LLM 能不能在个人电脑上跑?”答案是能,虽然慢,但技术上是可行的。更重要的是,它打开了后续优化的空间:更高效的量化方案、更智能的 KV cache 管理、更激进的权重卸载策略——每一点改进都在这个已验证的路径上叠加。当 M7 或 M8 的统一内存突破 1TB 时,Kimi K3 级别的模型在笔记本上流畅运行将不再是幻想,而 gavamedia 的这次实验,就是这条路线的起点。

  • 标题: Kimi K3 在 M1 Max 上跑起来了:0.3 tok/s 但路径打通了
  • 作者: lxiol
  • 创建于 : 2026-07-30 00:00:00
  • 更新于 : 2026-07-30 23:25:39
  • 链接: https://blog.lxiol.cn/2026/07/30/kimi-k3-m1-max-local-inference/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。