每个月17亿token免费用,这个开源项目真好

lxiol
📝
每个月17亿token免费用,这个开源项目真好想用大模型,又嫌 API 太贵。

原文链接:https://mp.weixin.qq.com/s/ghw40a8g9XgwEVzBfB62jw

每个月17亿token免费用,这个开源项目真好想用大模型,又嫌 API 太贵。

每个月17亿token免费用,这个开源项目真好

想用大模型,又嫌 API 太贵。

这事儿困扰过很多人——
但其实几乎每家大厂都给了免费额度,
Google、Groq、Cerebras、Mistral、Cohere、NVIDIA、HuggingFace、OpenRouter、GitHub Models、Cloudflare……

16 家厂商,加起来大约 17 亿 tokens 每个月。

单看每一家都像”玩具”——
放在一起,就是一个真能干活的额度池。

问题是:
16 个网站、16 套 SDK、16 个地方可能出状况。
手撸这套聚合?想想就累。

FreeLLMAPI 把这件事压成了一个端点。

One OpenAI-compatible endpoint. Sixteen free LLM providers. ~1.7B tokens per month.

它是一个本地跑的聚合网关,
把 16 家免费 LLM 的额度,揉成 1 个 OpenAI 兼容接口

你只要改一行 base_url
所有用 OpenAI SDK 的工具(LangChain、LlamaIndex、Continue、Hermes、各种 Agent……)

全部接得通

🚀 30 秒跑起来

Docker 一行安装:

1
`curl -fsSL https://tashfeenahmed.github.io/freellmapi/install.sh | bash`

或手动:

1
2
3
4
5
`git clone https://github.com/tashfeenahmed/freellmapi.git
cd freellmapi
ENCRYPTION_KEY="$(openssl rand -hex 32)"
printf "ENCRYPTION_KEY=%s\nPORT=3001\n" "$ENCRYPTION_KEY" > .env
docker compose up -d`

打开 http://localhost:3001
在 Keys 页面贴上你各家的免费 key,
Fallback Chain 里调一下优先级,
拿一个统一的 freellmapi-... 密钥,完事。

Docker 镜像多架构(linux/amd64 + linux/arm64),
树莓派也能跑

🎯 它和”自己用各家 API”的差别

自己用各家免费额度,麻烦在三处

  • • 额度用超 — 一家用超了,要手动切下一家
  • • SDK 不一样 — 16 套调用方式,迁移成本爆炸
  • • key 管理 — 16 个 key 散在配置文件/env 里,丢了不知道

FreeLLMAPI 把这三件事都包了:

  • • 自动 fallback — 一个 provider 返 429 / 5xx / 超时,路由自动跳下一个,最多重试 20 次
  • • OpenAI 兼容 — /v1/chat/completions/v1/responses/v1/embeddings/v1/models 全部按 OpenAI 协议走,改 base_url 即可
  • • 加密存储 — 所有 key 用 AES-256-GCM 加密落 SQLite,解密只在请求时内存里做

外加:

  • • Per-key 额度跟踪 — RPM / RPD / TPM / TPD 每个 (platform, model, key) 单独计数,永远不会超 free tier
  • • Sticky sessions — 多轮对话锁同一模型 30 分钟,避免中途换模型导致的”幻觉跳变”
  • • 健康检查 — 定时探活,标记 healthy / rate_limited / invalid / error,路由自动绕开死 key

🌐 支持的 16 家(选你最熟的几个)

Provider

代表模型
Google
Gemini 2.5 Flash · 3.x previews
Groq
Llama 3.3 · Llama 4 · Qwen3
Cerebras
Qwen3 235B
OpenRouter
21 个免费模型
GitHub Models
GPT-4.1 · GPT-4o
Cloudflare
Kimi K2 · GLM-4.7 · GPT-OSS
HuggingFace
DeepSeek V4 · Kimi K2.6 · Qwen3
Cohere
Command R+ · Command-A
Ollama Cloud
GLM-4.7 · Kimi K2 · Qwen3

还有 NVIDIA、Z.ai (Zhipu)、Mistral、Kilo Gateway、Pollinations、LLM7、OpenCode Zen。

Plus 一个 custom provider——可以指向任何 OpenAI 兼容端点(llama.cpp、LM Studio、vLLM、本地 Ollama、私有网关),
从 Keys 页面直接配。

🛠️ 用起来什么样(Python)

1
2
3
4
5
6
7
8
9
10
11
12
13
`from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:3001/v1",
    api_key="freellmapi-your-unified-key",
)

resp = client.chat.completions.create(
    model="auto",  # 让路由器挑;或者写死 "gemini-2.5-flash"
    messages=[{"role": "user", "content": "用一句话总结罗马的衰亡。"}],
)
print(resp.choices[0].message.content)
print("Routed via:", resp.headers.get("x-routed-via"))`

model="auto" 是关键——让路由器按 fallback chain 顺序挑,
哪家有额度就用哪家。

流式、Tool calling、Embeddings 全部按 OpenAI 协议 round-trip。
Continue、Hermes、Claude Code、各种 Agent 工具直接接

🖥️ 桌面端也有

除了 Docker 服务端,还有个原生菜单栏 App (desktop/):
整套路由 + dashboard 跑在系统托盘,点开玻璃弹窗看实时请求统计。

本地构建:

1
2
3
`npm install
npm run desktransform: translateY(dist        # macOS: FreeLLMAPI-…-arm64.dmg
npm run desktop:dist:win    # Windows installer`

没代码签名,本地构建没 Gatekeeper 警告。

📋 亮点速览

  • • 定位:16 个免费 LLM 提供商的 OpenAI 兼容聚合网关
  • • 协议:OpenAI Chat / Responses / Embeddings / Models 全兼容
  • • 模型数:100+ 跨 16 家
  • • 免费额度池:~1.7B tokens / 月
  • • 容错策略:自动 fallback,最多 20 次重试
  • • 加密:AES-256-GCM 静态加密 key
  • • 部署:Docker / Docker Compose / 原生 Node 20+
  • • 平台:Windows / macOS / Linux / ARM SBC
  • • 许可证:MIT
  • • 桌面端:菜单栏 App(macOS / Windows)

GitHub:
https://github.com/tashfeenahmed/freellmapi

薅免费额度这事,单家是玩具,16 家叠起来是真香

FreeLLMAPI 让你只关心一件事:写 prompt
至于背后跑的是 Gemini 还是 Llama 还是 Kimi——让路由器帮你算

#开源工具 #LLM #大模型 #AI编程 #OpenAI #API聚合 #免费API #Docker #树莓派


💬 本文评论区已开启,但暂无读者留言。

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: 每个月17亿token免费用,这个开源项目真好
  • 作者: lxiol
  • 创建于 : 2026-07-03 16:25:20
  • 更新于 : 2026-07-03 16:25:20
  • 链接: https://blog.lxiol.cn/2026/07/03/每个月17亿token免费用这个开源项目真好/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
目录
每个月17亿token免费用,这个开源项目真好