每个月17亿token免费用,这个开源项目真好
每个月17亿token免费用,这个开源项目真好想用大模型,又嫌 API 太贵。
每个月17亿token免费用,这个开源项目真好
想用大模型,又嫌 API 太贵。
这事儿困扰过很多人——
但其实几乎每家大厂都给了免费额度,
Google、Groq、Cerebras、Mistral、Cohere、NVIDIA、HuggingFace、OpenRouter、GitHub Models、Cloudflare……

16 家厂商,加起来大约 17 亿 tokens 每个月。
单看每一家都像”玩具”——
放在一起,就是一个真能干活的额度池。
问题是:
16 个网站、16 套 SDK、16 个地方可能出状况。
手撸这套聚合?想想就累。
FreeLLMAPI 把这件事压成了一个端点。
One OpenAI-compatible endpoint. Sixteen free LLM providers. ~1.7B tokens per month.
它是一个本地跑的聚合网关,
把 16 家免费 LLM 的额度,揉成 1 个 OpenAI 兼容接口。
你只要改一行 base_url,
所有用 OpenAI SDK 的工具(LangChain、LlamaIndex、Continue、Hermes、各种 Agent……)

全部接得通。
🚀 30 秒跑起来
Docker 一行安装:
1 | `curl -fsSL https://tashfeenahmed.github.io/freellmapi/install.sh | bash` |
或手动:
1 | `git clone https://github.com/tashfeenahmed/freellmapi.git |
打开 http://localhost:3001,
在 Keys 页面贴上你各家的免费 key,
Fallback Chain 里调一下优先级,
拿一个统一的 freellmapi-... 密钥,完事。
Docker 镜像多架构(linux/amd64 + linux/arm64),
树莓派也能跑。
🎯 它和”自己用各家 API”的差别
自己用各家免费额度,麻烦在三处:
- • 额度用超 — 一家用超了,要手动切下一家
- • SDK 不一样 — 16 套调用方式,迁移成本爆炸
- • key 管理 — 16 个 key 散在配置文件/env 里,丢了不知道

FreeLLMAPI 把这三件事都包了:
- • 自动 fallback — 一个 provider 返 429 / 5xx / 超时,路由自动跳下一个,最多重试 20 次
- • OpenAI 兼容 —
/v1/chat/completions、/v1/responses、/v1/embeddings、/v1/models全部按 OpenAI 协议走,改 base_url 即可 - • 加密存储 — 所有 key 用 AES-256-GCM 加密落 SQLite,解密只在请求时内存里做

外加:
- • Per-key 额度跟踪 — RPM / RPD / TPM / TPD 每个
(platform, model, key)单独计数,永远不会超 free tier - • Sticky sessions — 多轮对话锁同一模型 30 分钟,避免中途换模型导致的”幻觉跳变”
- • 健康检查 — 定时探活,标记
healthy/rate_limited/invalid/error,路由自动绕开死 key
🌐 支持的 16 家(选你最熟的几个)
Provider
代表模型
Google
Gemini 2.5 Flash · 3.x previews
Groq
Llama 3.3 · Llama 4 · Qwen3
Cerebras
Qwen3 235B
OpenRouter
21 个免费模型
GitHub Models
GPT-4.1 · GPT-4o
Cloudflare
Kimi K2 · GLM-4.7 · GPT-OSS
HuggingFace
DeepSeek V4 · Kimi K2.6 · Qwen3
Cohere
Command R+ · Command-A
Ollama Cloud
GLM-4.7 · Kimi K2 · Qwen3
还有 NVIDIA、Z.ai (Zhipu)、Mistral、Kilo Gateway、Pollinations、LLM7、OpenCode Zen。
Plus 一个 custom provider——可以指向任何 OpenAI 兼容端点(llama.cpp、LM Studio、vLLM、本地 Ollama、私有网关),
从 Keys 页面直接配。
🛠️ 用起来什么样(Python)
1 | `from openai import OpenAI |
model="auto" 是关键——让路由器按 fallback chain 顺序挑,
哪家有额度就用哪家。
流式、Tool calling、Embeddings 全部按 OpenAI 协议 round-trip。
Continue、Hermes、Claude Code、各种 Agent 工具直接接。
🖥️ 桌面端也有
除了 Docker 服务端,还有个原生菜单栏 App (desktop/):
整套路由 + dashboard 跑在系统托盘,点开玻璃弹窗看实时请求统计。
本地构建:
1 | `npm install |
没代码签名,本地构建没 Gatekeeper 警告。
📋 亮点速览
- • 定位:16 个免费 LLM 提供商的 OpenAI 兼容聚合网关
- • 协议:OpenAI Chat / Responses / Embeddings / Models 全兼容
- • 模型数:100+ 跨 16 家
- • 免费额度池:~1.7B tokens / 月
- • 容错策略:自动 fallback,最多 20 次重试
- • 加密:AES-256-GCM 静态加密 key
- • 部署:Docker / Docker Compose / 原生 Node 20+
- • 平台:Windows / macOS / Linux / ARM SBC
- • 许可证:MIT
- • 桌面端:菜单栏 App(macOS / Windows)
GitHub:
https://github.com/tashfeenahmed/freellmapi
薅免费额度这事,单家是玩具,16 家叠起来是真香。
FreeLLMAPI 让你只关心一件事:写 prompt。
至于背后跑的是 Gemini 还是 Llama 还是 Kimi——让路由器帮你算。
#开源工具 #LLM #大模型 #AI编程 #OpenAI #API聚合 #免费API #Docker #树莓派
💬 本文评论区已开启,但暂无读者留言。
本文转载自微信公众号,如有侵权请联系删除。
- 标题: 每个月17亿token免费用,这个开源项目真好
- 作者: lxiol
- 创建于 : 2026-07-03 16:25:20
- 更新于 : 2026-07-03 16:25:20
- 链接: https://blog.lxiol.cn/2026/07/03/每个月17亿token免费用这个开源项目真好/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。