部署你的第一个本地 AI:3款无审查模型 + llama.cpp 完整教程

lxiol

原文链接:https://mp.weixin.qq.com/s/Wp4IdvkJnBU-eQ5n0KVFWA

这篇教程教你做一件事:在你自己的电脑上跑起一个 AI 大模型。不联网,不限制,不收费。

这篇教程教你做一件事:

在你自己的电脑上跑起一个 AI 大模型。不联网,不限制,不收费。

读完跟着做,半小时内你会拥有一个本地 AI 服务。它提供 OpenAI 兼容的 API 接口。你现有的 AI 工具都能直接对接。

完成后的样子

前提条件

  • Windows 10/11 电脑
  • 显卡显存 8GB 以上(NVIDIA 或 AMD)
  • 硬盘剩余空间 25GB 以上
  • 不需要任何编程基础

三个模型怎么选

先说结论。根据你的显存大小选:

显存

推荐模型

文件大小

特点

8-12GB

Qwen3.6-35B-A3B-Uncensored IQ2_M

11.7GB

速度最快,支持图片理解

12-16GB

Gemma-4-31B-Jang-Crack Q3_K_M

15.3GB

质量和速度平衡

16-24GB

Gemma-4-31B-Jang-Crack Q4_K_M

18.7GB

输出质量最好

不知道自己显存多大?右键桌面 → NVIDIA 控制面板 → 左下角”系统信息”里能看到。

AMD 显卡:设置 → 系统 → 显示 → 高级显示设置 → 显示适配器属性。

阶段一:下载模型和驱动

第一步:下载模型文件

选一个适合你显存的模型。下载链接:

Qwen3.6-35B-A3B-Uncensored(11.7GB,含视觉模型)

1
`HuggingFace: https://huggingface.co/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive/tree/main`

需要下载两个文件:

  • Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf(主模型)
  • mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf(视觉模块)

Gemma-4-31B-Jang-Crack Q3(15.3GB)

1
`HuggingFace: https://huggingface.co/douyamv/Gemma-4-31B-JANG_4M-CRACK-GGUF/tree/main`

Gemma-4-31B-Jang-Crack Q4(18.7GB)

1
`HuggingFace: https://huggingface.co/douyamv/Gemma-4-31B-JANG_4M-CRACK-GGUF/tree/main`

下载完先放着,后面会统一放到指定文件夹。

第二步:更新显卡驱动

NVIDIA 用户:

1
`驱动下载:https://www.nvidia.cn/geforce/drivers/`

打开链接。选你的显卡型号。下载安装。重启。

关键一步: 安装 CUDA Toolkit。这会让模型推理速度提升 3-5 倍。

1
`CUDA 下载:https://developer.nvidia.com/cuda-downloads`

选 Windows → x86_64 → 你的系统版本 → exe(local)。下载安装即可。

AMD 用户:

1
`驱动下载:https://www.amd.com/zh-cn/support/download/drivers.html`

选你的显卡型号,更新到最新版本。

验证: 打开命令提示符,输入 nvidia-smi(N 卡)。能看到驱动版本和 CUDA 版本就对了。

阶段二:部署 llama.cpp

第三步:下载 llama.cpp

1
`GitHub 官方:https://github.com/ggml-org/llama.cpp/releases`

去 GitHub Releases 页面。找到最新版本(目前是 b9667)。

下载对应你系统的版本:

  • NVIDIA 显卡:选带 cuda 字样的包
  • AMD 显卡:选带 vulkan 字样的包
  • 仅 CPU:选普通版本

下载后解压到一个路径简单的位置。我用的是:

1
`D:\llama-cpp\`

解压后你会看到一堆 exe 文件。最重要的是 llama-server.exe

第四步:组织文件结构

在 llama.cpp 解压目录下建一个 models 文件夹。把第一步下载的模型文件放进去。

最终结构长这样:

1
2
3
4
5
6
7
8
`D:\llama-cpp\
├── llama-server.exe
├── llama-cli.exe
├── ... (其他 exe)
├── models\
│   ├── Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf
│   └── mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf
└── start.bat (下一步创建)`

第五步:创建启动脚本

新建一个文本文件。把下面的内容粘贴进去。另存为 start.bat,放在 llama.cpp 根目录。

如果你用的是 Qwen3.6(推荐新手用这个):

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
`@echo off
chcp 65001 >nul
cd /d "%~dp0"

echo.
echo ========================================
echo   正在启动 Qwen3.6-35B-A3B-Uncensored
echo   模型大小:11.7GB / 视觉:开启
echo   API 地址:http://127.0.0.1:8080/v1
echo ========================================
echo.

llama-server.exe ^
-m "models\Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf" ^
--mmproj "models\mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf" ^
-ngl 999 ^
-c 32768 ^
-n 8192 ^
-fa on ^
--cont-batching ^
--host 127.0.0.1 ^
--port 8080

pause`

如果你用的是 Gemma Q3:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
`@echo off
chcp 65001 >nul
cd /d "%~dp0"

echo.
echo ========================================
echo   正在启动 Gemma-4-31B-Jang-Crack Q3
echo   模型大小:15.3GB
echo   API 地址:http://127.0.0.1:8080/v1
echo ========================================
echo.

llama-server.exe ^
-m "models\gemma-4-31b-jang-crack-Q3_K_M.gguf" ^
-ngl 999 ^
-c 16384 ^
-n 8192 ^
-fa on ^
--cont-batching ^
--host 127.0.0.1 ^
--port 8080

pause`

如果你用的是 Gemma Q4:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
`@echo off
chcp 65001 >nul
cd /d "%~dp0"

echo.
echo ========================================
echo   正在启动 Gemma-4-31B-Jang-Crack Q4
echo   模型大小:18.7GB
echo   API 地址:http://127.0.0.1:8080/v1
echo ========================================
echo.

llama-server.exe ^
-m "models\gemma-4-31b-jang-crack-Q4_K_M.gguf" ^
-ngl 999 ^
-c 12288 ^
-n 8192 ^
-fa on ^
--cont-batching ^
--host 127.0.0.1 ^
--port 8080

pause`

脚本里几个参数说明:

  • -ngl 999:把所有层都丢给 GPU 计算。数字大于模型层数即可
  • -c 32768:上下文窗口长度。显存不够就改小,比如 8192
  • -n 8192:单次最大生成 token 数
  • -fa on:开启 Flash Attention,减少显存占用
  • --cont-batching:连续批处理,多人同时用时更快

验证: 双击 start.bat。看到 server listening on 127.0.0.1:8080 就成功了。

阶段三:对接使用

第六步:打开浏览器测试

模型跑起来后,打开浏览器访问:

1
`http://127.0.0.1:8080`

llama.cpp 自带一个聊天界面。你可以直接在里面对话测试。

能正常回复就说明一切就绪。

第七步:对接 AI 客户端

本地模型启动后提供的是 OpenAI 兼容 API。配置方法统一:

1
2
3
`API 地址:http://127.0.0.1:8080/v1
API Key:随便填,比如 sk-local(本地不验证)
模型名称:留空或填任意值`

可对接的工具:

  • OpenClaw:设置 → 模型提供商 → 自定义 → 填入上面的地址
  • Hermes Agent:配置文件里改 base_url 为本地地址
  • Claude Code CLI:设置 API endpoint 为本地地址
  • 任何支持 OpenAI API 的工具:改 base_url 即可

试了一下。在 OpenClaw 里对接后,体验和用云端 API 几乎一样。区别只是——你的数据没有离开这台电脑。

完整流程一览

第一次做的建议

  • 先用 Qwen3.6 那个 11.7GB 的练手。它对显存要求最低,而且有视觉能力可以玩
  • 上下文长度(-c)先设小一点,比如 8192。跑通了再慢慢加大
  • 第一次启动会比较慢(模型加载到显存需要时间)。后续对话响应是很快的
  • 如果显存不够会自动溢出到内存/硬盘,速度会明显变慢。这时候换个小一号的量化版本

容易踩的坑

1. 启动后立刻报错闪退

大概率是模型路径不对。检查 bat 文件里的路径和实际文件名是否完全一致。注意大小写和空格。

2. 回复速度极慢(每秒只有1-2个字)

显存不够了。模型被迫用 CPU 计算。解决:把 -c 调小(比如 4096),或者换 Q3/Q2 量化版本。

3. CUDA 没有加速效果

确认安装了 CUDA Toolkit,并且下载的 llama.cpp 是 cuda 版本。普通版不支持 GPU 加速。

4. 对接客户端时报 connection refused

确认 llama-server 还在运行。确认地址写的是 http://127.0.0.1:8080/v1。注意最后有个 /v1

5. Qwen3.6 的视觉功能不工作

需要同时加载 mmproj 文件。检查启动脚本里 --mmproj 参数是否正确指向了那个 f16.gguf 文件。

性能参考

实际跑起来能有多快?根据社区测试数据:

配置

模型

速度

RTX 3060 12GB

Qwen3.6 IQ2_M

~15-20 tokens/s

RTX 4070 12GB

Qwen3.6 IQ2_M

~25-35 tokens/s

RTX 3090 24GB

Gemma Q4_K_M

~20-30 tokens/s

RTX 4090 24GB

Gemma Q4_K_M

~35-50 tokens/s

日常对话体验:Qwen3.6 在 12GB 显卡上已经足够流畅。Gemma Q4 在 24GB 显卡上体验非常好。

对比参考:云端 Claude 大约 50-80 tokens/s。本地虽然慢一些,但没有网络延迟,而且隐私、成本优势完全在你这边。

收尾

这套方案跑起来之后,你拥有的是:

一个完全离线的 AI 助手。没有审查。没有限制。没有月费。数据不出本机。

它不是 Claude 的完美替代。在复杂推理方面还有差距。

但它是你的。

不会因为一封信、一条政策、一次涨价而消失。

这就够了。

进阶:让本地模型联网搜索

本地模型最大的短板是信息过时。它只知道训练截止日期之前的事。

但这个问题有解。

搭配 Open WebUI 或 SearXNG(一个开源的搜索引擎聚合器),可以给本地模型加上联网搜索能力。模型在回答前先搜索最新信息,然后基于搜索结果生成回复。

一旦加上搜索,本地模型就不再是”离线聊天机器人”。它开始像一个真正的助手。

有开发者测试后说:”云端和本地之间的差距,一个搜索开关就抹平了大半。”

进阶:混合架构

如果你既想要本地的隐私,又偶尔需要云端的强推理能力:

  • 敏感数据(客户信息、内部文档、代码)→ 走本地模型,数据不出机
  • 不涉及隐私的复杂任务(公开信息的分析、创意写作)→ 走云端 API

这叫”混合架构”。用一个路由层根据任务敏感度自动分流。

原则:如果数据不能离开你的基础设施,请求永远不碰云端。

原理拆解和背景分析见上一篇:《Claude 最强模型被禁,”开源模型”才是真自由》

素材来源:llama.cpp GitHub[1] | Qwen3.6-35B-A3B-Uncensored 下载[2] | Gemma-4-31B-JANG-CRACK GGUF 下载[3]

Reference

[1] 
llama.cpp GitHub: https://github.com/ggml-org/llama.cpp
[2] 
Qwen3.6-35B-A3B-Uncensored 下载: https://huggingface.co/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive/tree/main
[3] 
Gemma-4-31B-JANG-CRACK GGUF 下载: https://huggingface.co/douyamv/Gemma-4-31B-JANG_4M-CRACK-GGUF/tree/main

下方是赋能君的AI学习交流永久免费星球,想学习更多内容,欢迎扫码加入。


🙌 如果你阅读到这里,说明我们对信息的认可区域是有一定交集的,可以说我们是同道中人,所以如果你有自认为不错的信息获取渠道,欢迎留言或者私聊我,谢谢。

都看到这里了,就给个关注吧👀:

喜欢我的文章,可以请你右下角顺手来一波点赞&在看&分享三连么👉

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: 部署你的第一个本地 AI:3款无审查模型 + llama.cpp 完整教程
  • 作者: lxiol
  • 创建于 : 2026-06-20 01:24:15
  • 更新于 : 2026-06-20 01:24:15
  • 链接: https://blog.lxiol.cn/2026/06/20/部署你的第一个本地-AI3款无审查模型-llamacpp-完整教程/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。