部署你的第一个本地 AI:3款无审查模型 + llama.cpp 完整教程
这篇教程教你做一件事:在你自己的电脑上跑起一个 AI 大模型。不联网,不限制,不收费。

这篇教程教你做一件事:
在你自己的电脑上跑起一个 AI 大模型。不联网,不限制,不收费。
读完跟着做,半小时内你会拥有一个本地 AI 服务。它提供 OpenAI 兼容的 API 接口。你现有的 AI 工具都能直接对接。
完成后的样子

前提条件
- Windows 10/11 电脑
- 显卡显存 8GB 以上(NVIDIA 或 AMD)
- 硬盘剩余空间 25GB 以上
- 不需要任何编程基础
三个模型怎么选
先说结论。根据你的显存大小选:
显存
推荐模型
文件大小
特点
8-12GB
Qwen3.6-35B-A3B-Uncensored IQ2_M
11.7GB
速度最快,支持图片理解
12-16GB
Gemma-4-31B-Jang-Crack Q3_K_M
15.3GB
质量和速度平衡
16-24GB
Gemma-4-31B-Jang-Crack Q4_K_M
18.7GB
输出质量最好
不知道自己显存多大?右键桌面 → NVIDIA 控制面板 → 左下角”系统信息”里能看到。
AMD 显卡:设置 → 系统 → 显示 → 高级显示设置 → 显示适配器属性。
阶段一:下载模型和驱动
第一步:下载模型文件
选一个适合你显存的模型。下载链接:
Qwen3.6-35B-A3B-Uncensored(11.7GB,含视觉模型)
1 | `HuggingFace: https://huggingface.co/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive/tree/main` |
需要下载两个文件:
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf(主模型)mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf(视觉模块)
Gemma-4-31B-Jang-Crack Q3(15.3GB)
1 | `HuggingFace: https://huggingface.co/douyamv/Gemma-4-31B-JANG_4M-CRACK-GGUF/tree/main` |
Gemma-4-31B-Jang-Crack Q4(18.7GB)
1 | `HuggingFace: https://huggingface.co/douyamv/Gemma-4-31B-JANG_4M-CRACK-GGUF/tree/main` |
下载完先放着,后面会统一放到指定文件夹。
第二步:更新显卡驱动
NVIDIA 用户:
1 | `驱动下载:https://www.nvidia.cn/geforce/drivers/` |
打开链接。选你的显卡型号。下载安装。重启。
关键一步: 安装 CUDA Toolkit。这会让模型推理速度提升 3-5 倍。
1 | `CUDA 下载:https://developer.nvidia.com/cuda-downloads` |
选 Windows → x86_64 → 你的系统版本 → exe(local)。下载安装即可。
AMD 用户:
1 | `驱动下载:https://www.amd.com/zh-cn/support/download/drivers.html` |
选你的显卡型号,更新到最新版本。
验证: 打开命令提示符,输入 nvidia-smi(N 卡)。能看到驱动版本和 CUDA 版本就对了。
阶段二:部署 llama.cpp
第三步:下载 llama.cpp
1 | `GitHub 官方:https://github.com/ggml-org/llama.cpp/releases` |
去 GitHub Releases 页面。找到最新版本(目前是 b9667)。
下载对应你系统的版本:
- NVIDIA 显卡:选带
cuda字样的包 - AMD 显卡:选带
vulkan字样的包 - 仅 CPU:选普通版本
下载后解压到一个路径简单的位置。我用的是:
1 | `D:\llama-cpp\` |
解压后你会看到一堆 exe 文件。最重要的是 llama-server.exe。
第四步:组织文件结构
在 llama.cpp 解压目录下建一个 models 文件夹。把第一步下载的模型文件放进去。
最终结构长这样:
1 | `D:\llama-cpp\ |
第五步:创建启动脚本
新建一个文本文件。把下面的内容粘贴进去。另存为 start.bat,放在 llama.cpp 根目录。
如果你用的是 Qwen3.6(推荐新手用这个):
1 | `@echo off |
如果你用的是 Gemma Q3:
1 | `@echo off |
如果你用的是 Gemma Q4:
1 | `@echo off |
脚本里几个参数说明:
-ngl 999:把所有层都丢给 GPU 计算。数字大于模型层数即可-c 32768:上下文窗口长度。显存不够就改小,比如 8192-n 8192:单次最大生成 token 数-fa on:开启 Flash Attention,减少显存占用--cont-batching:连续批处理,多人同时用时更快
验证: 双击 start.bat。看到 server listening on 127.0.0.1:8080 就成功了。
阶段三:对接使用
第六步:打开浏览器测试
模型跑起来后,打开浏览器访问:
1 | `http://127.0.0.1:8080` |
llama.cpp 自带一个聊天界面。你可以直接在里面对话测试。
能正常回复就说明一切就绪。
第七步:对接 AI 客户端
本地模型启动后提供的是 OpenAI 兼容 API。配置方法统一:
1 | `API 地址:http://127.0.0.1:8080/v1 |
可对接的工具:
- OpenClaw:设置 → 模型提供商 → 自定义 → 填入上面的地址
- Hermes Agent:配置文件里改 base_url 为本地地址
- Claude Code CLI:设置 API endpoint 为本地地址
- 任何支持 OpenAI API 的工具:改 base_url 即可
试了一下。在 OpenClaw 里对接后,体验和用云端 API 几乎一样。区别只是——你的数据没有离开这台电脑。
完整流程一览

第一次做的建议
- 先用 Qwen3.6 那个 11.7GB 的练手。它对显存要求最低,而且有视觉能力可以玩
- 上下文长度(-c)先设小一点,比如 8192。跑通了再慢慢加大
- 第一次启动会比较慢(模型加载到显存需要时间)。后续对话响应是很快的
- 如果显存不够会自动溢出到内存/硬盘,速度会明显变慢。这时候换个小一号的量化版本
容易踩的坑
1. 启动后立刻报错闪退
大概率是模型路径不对。检查 bat 文件里的路径和实际文件名是否完全一致。注意大小写和空格。
2. 回复速度极慢(每秒只有1-2个字)
显存不够了。模型被迫用 CPU 计算。解决:把 -c 调小(比如 4096),或者换 Q3/Q2 量化版本。
3. CUDA 没有加速效果
确认安装了 CUDA Toolkit,并且下载的 llama.cpp 是 cuda 版本。普通版不支持 GPU 加速。
4. 对接客户端时报 connection refused
确认 llama-server 还在运行。确认地址写的是 http://127.0.0.1:8080/v1。注意最后有个 /v1。
5. Qwen3.6 的视觉功能不工作
需要同时加载 mmproj 文件。检查启动脚本里 --mmproj 参数是否正确指向了那个 f16.gguf 文件。
性能参考
实际跑起来能有多快?根据社区测试数据:
配置
模型
速度
RTX 3060 12GB
Qwen3.6 IQ2_M
~15-20 tokens/s
RTX 4070 12GB
Qwen3.6 IQ2_M
~25-35 tokens/s
RTX 3090 24GB
Gemma Q4_K_M
~20-30 tokens/s
RTX 4090 24GB
Gemma Q4_K_M
~35-50 tokens/s
日常对话体验:Qwen3.6 在 12GB 显卡上已经足够流畅。Gemma Q4 在 24GB 显卡上体验非常好。
对比参考:云端 Claude 大约 50-80 tokens/s。本地虽然慢一些,但没有网络延迟,而且隐私、成本优势完全在你这边。
收尾
这套方案跑起来之后,你拥有的是:
一个完全离线的 AI 助手。没有审查。没有限制。没有月费。数据不出本机。
它不是 Claude 的完美替代。在复杂推理方面还有差距。
但它是你的。
不会因为一封信、一条政策、一次涨价而消失。
这就够了。
进阶:让本地模型联网搜索
本地模型最大的短板是信息过时。它只知道训练截止日期之前的事。
但这个问题有解。
搭配 Open WebUI 或 SearXNG(一个开源的搜索引擎聚合器),可以给本地模型加上联网搜索能力。模型在回答前先搜索最新信息,然后基于搜索结果生成回复。
一旦加上搜索,本地模型就不再是”离线聊天机器人”。它开始像一个真正的助手。
有开发者测试后说:”云端和本地之间的差距,一个搜索开关就抹平了大半。”
进阶:混合架构
如果你既想要本地的隐私,又偶尔需要云端的强推理能力:
- 敏感数据(客户信息、内部文档、代码)→ 走本地模型,数据不出机
- 不涉及隐私的复杂任务(公开信息的分析、创意写作)→ 走云端 API
这叫”混合架构”。用一个路由层根据任务敏感度自动分流。
原则:如果数据不能离开你的基础设施,请求永远不碰云端。
原理拆解和背景分析见上一篇:《Claude 最强模型被禁,”开源模型”才是真自由》
素材来源:llama.cpp GitHub[1] | Qwen3.6-35B-A3B-Uncensored 下载[2] | Gemma-4-31B-JANG-CRACK GGUF 下载[3]
Reference
[1]
llama.cpp GitHub: https://github.com/ggml-org/llama.cpp
[2]
Qwen3.6-35B-A3B-Uncensored 下载: https://huggingface.co/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive/tree/main
[3]
Gemma-4-31B-JANG-CRACK GGUF 下载: https://huggingface.co/douyamv/Gemma-4-31B-JANG_4M-CRACK-GGUF/tree/main
下方是赋能君的AI学习交流永久免费星球,想学习更多内容,欢迎扫码加入。

🙌 如果你阅读到这里,说明我们对信息的认可区域是有一定交集的,可以说我们是同道中人,所以如果你有自认为不错的信息获取渠道,欢迎留言或者私聊我,谢谢。
都看到这里了,就给个关注吧👀:
喜欢我的文章,可以请你右下角顺手来一波点赞&在看&分享三连么👉
本文转载自微信公众号,如有侵权请联系删除。
- 标题: 部署你的第一个本地 AI:3款无审查模型 + llama.cpp 完整教程
- 作者: lxiol
- 创建于 : 2026-06-20 01:24:15
- 更新于 : 2026-06-20 01:24:15
- 链接: https://blog.lxiol.cn/2026/06/20/部署你的第一个本地-AI3款无审查模型-llamacpp-完整教程/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。