六张RTX Pro 6000横跨六州跑通GLM-5.2!744B大模型在公网飙出30 tok/s,「去中心化推理」这次撕掉了PPT标签

lxiol

原文链接:https://mp.weixin.qq.com/s/bhbE7RTQv6-2Fgr3UCFfAw

六张RTX Pro 6000横跨六州跑通GLM-5.2!744B大模型在公网飙出30 tok/s,「去中心化推理」这次撕掉了PPT标签

2026年6月18日,电气工程师 @leyten 在 X 上扔出了一条帖子,配了一张终端截图。

截图里只有一个数字:30.55 tok/s

leyten在X发布的主帖与运行结果截图

▲ @leyten 主帖:「Wow, it has happened!」六张 RTX Pro 6000 横跨美国 WAN,跑 GLM-5.2 744B 模型,达到 30.55 tok/s。1482 赞、23.6 万浏览

但这张截图的背景,才是让整个技术圈集体沉默的原因——

这个速度的背后,没有数据中心,没有一排 H100,没有 NVLink。只有六张 NVIDIA RTX PRO 6000,物理上分散在美国六个不同的州:内华达、得克萨斯、明尼苏达、密苏里、犹他,再加一个华盛顿州的协调节点。卡与卡之间靠公网互联,节点间延迟 22 到 75 毫秒。

“Wow, it has happened! 30.55 tok/s on GLM-5.2 4-bit (from @Zai_org) ran by six RTX Pro 6000’s across the USA scattered over WAN!”

「哇,这终于实现了!来自 @Zai_org 的 GLM-5.2 4-bit 模型,在横跨美国、分散在广域网上的六张 RTX Pro 6000 上跑出了 30.55 tok/s!」

744B 参数的超大模型,在公开互联网上以每秒 30 个 token 的速度推理。项目代码已在 GitHub 开源(Apache 2.0),附带一份所有节点公网 IP、GPU UUID、逐跳延迟和输出哈希的可验证收据。

去中心化 AI 推理,从今天起有了第一份硬证据。

被跑通的模型,本身就不简单

GLM-5.2 是智谱 AI(Zhipu AI / z.ai)在 6 月中旬发布的最新旗舰。MIT 开源权重,744B 总参数、MoE 架构下每次激活约 40B 参数,1M token 的可靠上下文窗口。

GLM-5.2 HuggingFace模型页与基准测试表

▲ GLM-5.2 HF 模型卡,多项 Reasoning/Coding/Agentic 基准得分亮眼,对比多家闭源与开源模型

看基准:SWE-bench Pro 62.1,DeepSWE 46.2,AIME 2026 99.2,GPQA-Diamond 91.2。在开放权重模型类别中,GLM-5.2 在多个 agentic coding 指标上压过或逼近数个闭源前沿模型。Cloudflare Workers AI 已经在浏览器端提供试用入口。

技术上,IndexShare 机制每四层共享 indexer,将 1M 上下文下的每 token FLOPs 压低了 2.9 倍。改进后的 MTP 层让投机解码的接受长度提升了最多 20%。

但纸面参数好和“能在公网上跑起来”,中间隔着一整条技术鸿沟。

六张卡,六个州,一条公网流水线

先看硬件。RTX PRO 6000 Blackwell(GB202/SM120),96GB GDDR7 显存,带宽约 1.8 TB/s,TDP 600W 级。定位是专业工作站/服务器卡,在消费级硬件社区里已经是跑大模型的“重型武器”。

但通常用法是本地 PCIe 多卡并联,延迟微秒级。而 @leyten 的架构完全不同——

他把 GLM-5.2 的 78 层 Transformer 切成六段,每段 13 层,分别装在六台位于不同州、通过公网 IP 互通的机器上。协调节点(华盛顿州)只持有 embedding/lm_head 外加一个小型 GLM-4-9B draft 模型。没有一台机器掌握完整权重。

输入 prompt 生成激活值后,数据像流水线一样在美国地图上跑了一圈:内华达 → 得克萨斯 → 华盛顿 → 明尼苏达 → 密苏里 → 犹他,尾节点算完后直接把结果发回协调节点。

Shard仓库首页与优化路径表

▲ GitHub 仓库 leyten/shard 首页。清楚列出六卡配置、层切分方案,以及从 1.87 tok/s 到 30 tok/s 的五步优化路径

从 1.87 到 30:一次软件层面的「延迟谋杀」

真正值得细看的,是这个数字的爬坡过程。README 里记录了一条清晰的优化链路:

  • Plain KV decode
    :最朴素的逐 token 跨国往返——1.87 tok/s。每生成一个 token,都要等激活值横穿整个美国再回来。延迟把算力死死卡住。
  • + Deep-draft speculative decode + relay
    :让 GLM-4-9B 小模型先猜出多个候选 token,大模型一次验证——1.99 tok/s。略有改善,但 WAN 占用率仍接近 100%。
  • + Ring direct-return
    :尾节点直接回传协调节点,砍掉中间跳数——2.94 tok/s
  • + Async pipelining
    :多批投机验证重叠飞行,WAN 占用率骤降到约 5%——16.6 tok/s。这一步是转折点。
  • + CUDA-graphed draft
    :把 draft 小模型的逐 token 解码用 CUDA Graph “录像”回放,消除 GPU 启动开销,单 token 解码加速 3.8 倍——30.55 tok/s

每一步的逻辑都很直白,但聚合效应惊人:从基线到最终速度,纯靠软件优化翻了近 16 倍,硬件配置丝毫没动。

leyten贴出的演进图与async讨论

▲ @leyten 回复:演进图表 + 「this evolution is pretty insane, async did a lot」

“this evolution is pretty insane, async did a lot”

「这个演进相当疯狂,异步发挥了巨大作用。」

核心逻辑很朴素:在高延迟 WAN 上,往返次数才是真正的稀缺资源,算力反而是富裕的。投机解码把一次往返摊销到多个 token,异步流水线把等待时间填满,CUDA Graph 把剩下的启动开销吃干抹净。延迟被一层层地“藏”了起来。

传输层用的是 pickle-free 二进制帧 + ChaCha20-Poly1305 认证加密,干净、不占带宽、代码量不大。目前 Phase 0 跑公网直连端口,后续 Phase 1 会补 NAT 穿透和 relay 回退。

不需要信任,自己去验证

去中心化推理有一个老问题:你怎么确定对方真的在用远方六台真卡跑模型,没有在本地机房造假?

@leyten 的回答是:别信,自己去验。

仓库docs/目录下有一份 PROOF.md,列了四重验证:

  • 真实分散
    :每节点公网 IP 不同,GPU UUID 不同,geo 标签指向六个不同州;
  • 真实 WAN
    :逐跳 RTT 22-75ms,绝非 <1ms 局域网;
  • 输出正确可重现
    :greedy deterministic 模式下,token ids 哈希与单节点 eager 参考完全一致——tokens_match: true
  • 完全可重跑
    :Apache 2.0 开源 + 精确 commit hash + 引擎 sha256 + 层分配表,任何人拿相同 prompt 重算就能复现。

PROOF.md四重证明文档

▲ docs/PROOF.md:四重证明——IP/UUID/geo 证明真实节点、RTT 证明真实 WAN、token hash 证明输出正确、开源+commit 证明可重跑

收据文件docs/receipts/glm52-nvfp4-wan-20260618.json已落盘,里面记录了每个节点的公网 IP、GPU UUID、地理位置、以及 22-75ms 的逐跳 RTT。这份 JSON 同时验证了“六张卡确实在六个州”和“模型输出没有出错”。

在“去中心化推理”这个赛道上,多数项目还停留在白皮书和代币阶段。@leyten 直接扔了一份可独立核验的收据出来。

一个「人民算力」网络正在成形

这套系统 —— Shard —— 是更大项目 c0mpute 的底层推理引擎。

c0mpute.ai官网英雄页

▲ c0mpute.ai 官网:「AI powered by people, not data centers.」任何人分享 GPU 算力即可参与网络,强调由用户侧算力支撑 AI 服务

c0mpute 的愿景写在官网上:「AI powered by people, not data centers.」——人民算力驱动 AI,取代对数据中心的依赖。核心逻辑:任何人打开浏览器共享 GPU,就能获得项目奖励;用户用去中心化网络推理,减少对单一平台的依赖。

@leyten 在帖子里直接喊话:「Decentralized AI for the win, we’re coming for them.」剑指前沿模型 API 的定价权。

另一边,GLM-5.2 本身的开放策略也提供了底层燃料。MIT 许可、无地域锁、HF 上直接可下载。同一模型既能在 Cloudflare 边缘网络上以 $1.40/$4.40 每百万 token 的价格跑,也能在六张散落全美的 prosumer 卡上跑——基础设施彻底解耦。

边界仍然存在,但地基已经打好了

诚实地看,这套系统目前的约束也很明确:

  • 当前展示的是单用户低并发 greedy 推理,并发能力尚未验证;
  • 1M 长上下文下的吞吐和稳定性还需要更多实测;
  • 中间激活在传输过程中会被所在节点看到,隐私边界层(Phase 3 计划)还没有落地;
  • 节点的动态加入/退出、长期 uptime、激励机制,都在路线图上但尚未交付。

但这些问题,恰恰是“工程问题”而非“原理问题”。原理已经在 2026 年 6 月 18 日那天被打通了:六张 prosumer 显卡、公网高延迟、744B 参数模型、每秒 30 个 token、输出可验证可复现。

这五件事同时成立,本身就意味着一条新的路径被打开了——

前沿大模型的推理,不再被数据中心的高墙锁死。任何有 GPU 的人,未来的某一天,都可能成为这个网络中的一个节点。

@leyten 在 README 里还提了一笔平行实验:三张消费级 RTX 4090 跑 gpt-oss 120B,已经能冲到约 40 tok/s。参与门槛正在从“96GB 专业卡”向“玩家显卡”下探。

低门槛 + 开源权重 + 可验证收据 + 公网送达。去中心化 AI 推理的四个轮子,这次同时落了地。


💬 本文评论区已开启,但暂无读者留言。

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: 六张RTX Pro 6000横跨六州跑通GLM-5.2!744B大模型在公网飙出30 tok/s,「去中心化推理」这次撕掉了PPT标签
  • 作者: lxiol
  • 创建于 : 2026-06-22 16:21:23
  • 更新于 : 2026-06-30 17:05:34
  • 链接: https://blog.lxiol.cn/2026/06/22/六张RTX-Pro-6000横跨六州跑通GLM-52744B大模型在公网飙出30-toks去中心化推理这次撕掉了PPT标签/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。