Rapid-MLX:0.08s首字响应,让Mac也能丝滑玩转Agent

lxiol

没分清 MLX 和 oMLX?Mac 大模型江湖生态水这么深?

Rapid-MLX 是社区推荐的 Mac 引擎天花板,一个从个人独立开源项目逆袭为 Mac 生态成功案例的推理引擎。

性能王者有多强?

  • TTFT 仅需 0.08 秒:比 Ollama 快 2–4 倍,和官方 MLX 难分伯仲
  • 推理质量:内置 17 种工具,Tool Calling 能力硬核,4bit 模型几乎不见乱码
  • 冷启动:TTFT 时间比其他工具缩短 40% 到 92%
  • 轻松应对多模态和超长 Prompt

4 月正式推出,两个多月迭代了十多个版本。

一个人的逆袭

创始人 Raullen Chai 在项目之初连帮手都没有,GitHub 提交记录里超过 80% 的核心代码、技术文档、新特性测试报告都是个人手工打造。

项目的起源就是 Raullen 用 Mac 跑本地 Agent 时,受不了 Ollama 的龟速和 4-bit 量化下工具调用频繁报错,索性自己写了一个。后期引发即刻、V2EX 等开发社区广泛关注,吸引了一批 Mac MLX 生态、CUDA 优化和 Agent 框架领域的极客加入。

没有黑科技,同样闪光辉

Rapid 的两个核心工具都是社区和学术界的已有成果:

  • PFlash:社区开源的解决 TTFT 卡顿的工具,特别是长文本下 Prefill 太慢的问题
  • DFlash:UCSD 研究团队提出的解决生成速度瓶颈的方法,针对自回归模型一次只吐一个字的低效问题

Rapid 把学术成果转化为应用成果,既解决了首字延迟,又激活了吐字速度。

融合技术栈

  1. TurboQuant:把 KV 压缩 58%
  2. Radix Tree:精心设计的前缀缓存,引入 Mac 生态,是 TTFT 0.08 秒的关键工程
  3. Disk-Backed KV Checkpointing:解决长文本、多轮对话中物理内存不足问题,避免 OOM

适用限制

  1. 纯血 Mac 限定,Windows 没法用
  2. 没有图形化 UI,有上车门槛
  3. 仅支持 MLX,不支持 GGUF
  4. 推荐 24GB 以上 Mac 起步

本文转载自微信公众号,作者 dadababa。

  • 标题: Rapid-MLX:0.08s首字响应,让Mac也能丝滑玩转Agent
  • 作者: lxiol
  • 创建于 : 2026-07-02 21:00:00
  • 更新于 : 2026-07-03 02:07:46
  • 链接: https://blog.lxiol.cn/2026/07/02/rapid-mlx-fast-agent-inference-on-mac/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。