手把手教你!国内免费部署 Qwythos-9B,4G 显存就能跑 Claude 5 级推理
不管你是学生、设计师、还是第一次接触本地模型的纯小白,照着这篇一定能跑起来。
大家好,我是阿永。
很多朋友看了我之前那篇 Qwythos-9B 的评测,在后台问我:
“阿永,我完全不懂编程,怎么跑起来?”
“有没有不需要翻墙的下载方法?”
“4G 显存的笔记本能不能搞?”
今天这篇就是专门写给你们的。
全程大白话,带图带步骤,跟着点鼠标就行。
不管你是学生、设计师、还是第一次接触本地模型的纯小白,照着这篇一定能跑起来。

Qwythos-9B 本地部署教程封面
先搞清楚这是啥
Qwythos-9B 是一个可以在你自己电脑上运行的 AI 模型。
它相当于把 Claude 5 的”脑子”提取出来,塞进了一个 9B 的小模型里。
跟 ChatGPT 的区别:
- • 不用联网,断网也能用
- • 不用付费,电费就是全部成本
- • 没有审查,你让它写啥就写啥(当然请合法使用)
- • 数据不出你的电脑,隐私安全
需要的硬件:
最低 4GB 显存(NVIDIA 显卡),也就是大部分笔记本电脑都有的配置。
准备工作:先装 Python
如果电脑已经装了 Python,跳过这一步。
第一步:下载 Python
打开浏览器,访问:https://www.python.org/downloads/
点那个大大的黄色 “Download Python 3.10.x” 按钮。
第二步:安装 Python
下载完双击安装包。
下面这一步非常重要:
在安装界面最底部,有一个勾选框叫 “Add Python to PATH”。
一定要打勾。
然后点 “Install Now”,等着装完就行。
第一步:安装下载工具
这一步只需要一行命令。
Windows 用户
按下键盘上的 Win + R,输入 cmd,回车。
在弹出的黑色窗口里,输入下面这行命令,按回车:
1 | `pip install modelscope` |
等它跑完,出现一大串文字最后显示 Successfully installed,就成功了。

在 CMD 中安装 modelscope
第二步:下载模型(国内高速通道)
这里给两种下载方式,小白推荐方案二(GGUF 版),文件小、速度快。
方案一:下载完整版(适合服务器、大显存用户)
在刚才的黑色窗口里,输入:
1 | `modelscope download --model empero-ai/Qwythos-9B-Claude-Mythos-5-1M --local_dir ./models` |
这个命令会从阿里云魔搭社区下载,速度飞快,不需要翻墙。
方案二:下载 GGUF 轻量版(适合大部分个人电脑,推荐)
先设置镜像源(让下载走国内通道),输入:
1 | `set HF_ENDPOINT=https://hf-mirror.com` |
然后输入:
1 | `huggingface-cli download empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF --local-dir ./models` |
等进度条跑到 100% 就下好了。
下载完成后,你会在 ./models 文件夹里看到好几个 GGUF 文件。
选哪个?
文件名
大小
你的显卡
推荐
Q4_K_M
5.24 GB
4GB - 6GB
首选,大部分笔记本都能跑
Q5_K_M
6.02 GB
6GB - 8GB
质量和速度平衡
Q6_K
6.85 GB
8GB - 12GB
质量更好
Q8_0
8.87 GB
12GB 以上
接近无损,效果最好
第一次尝试,建议直接下 Q4_K_M,跑通了再换大的。
第三步:下载 llama.cpp(运行模型的核心程序)
打开浏览器,访问:
https://github.com/ggml-org/llama.cpp/releases
往下翻,找到最新版本的 Assets 区域。
找到这个文件(选你的系统):
- • Windows + NVIDIA 显卡:
llama-b3583-bin-win-cuda-cu12.6.7z - • Windows 普通版:
llama-b3583-bin-win-avx2-x64.7z
点击下载,得到一个 .7z 压缩包。
下载完解压到你的 D盘 或者 E盘,比如 D:\llama.cpp\。
第四步:整理文件夹结构
这一步非常重要,不要搞乱路径。
在 D:\llama.cpp(就是刚才解压出来的文件夹)里面,新建一个文件夹,叫 models。
然后把刚才下载的 GGUF 模型文件(那个 .gguf 文件)复制或移动到 models 文件夹里。
最后结构应该是这样:
1 | `D:\llama.cpp\ |

文件夹目录结构示意
第五步:创建启动脚本
这一步是小白最容易翻车的地方,注意看红字提醒。
在 D:\llama.cpp 文件夹里面,右键 → 新建 → 文本文档。
把下面这行代码复制进去:
1 | `llama-server.exe -m models/Qwythos-9B-Claude-Mythos-5-1M-Q4_K_M.gguf --host 0.0.0.0 --port 8080 -ngl 99` |
然后点 文件 → 另存为。
关键来了:
在”另存为”窗口里:
- 文件名输入:
启动.bat
- 文件名输入:
- 2. 编码选择:ANSI(重要!选错会乱码闪退)
- 保存类型选:所有文件
- 点击保存

记事本另存为选 ANSI 编码
保存后,文件夹里会出现一个 启动.bat 文件。
第六步:启动模型(见证奇迹的时刻)
如果你的显卡是 4GB-6GB:直接用上面那个 启动.bat 就行。
如果你的显卡是 8GB-12GB:右键 启动.bat → 编辑,把 Q4_K_M 改成 Q6_K 或 Q8_0。
如果你的显卡是 24GB 以上:可以跑完整版模型了。
双击 启动.bat。
会弹出一个黑色窗口,开始哗哗地滚代码。
看到这行字就说明成功了:
1 | `llama_server: model loaded |

启动成功的终端窗口
第七步:打开浏览器,开始聊天
保持那个黑色窗口不要关。
打开你的浏览器(Chrome、Edge 都行),在地址栏输入:
1 | `http://127.0.0.1:8080` |
回车,你会看到一个聊天界面。
在输入框里打字,模型就会回答你。

浏览器中的 Qwythos-9B 聊天界面
到这里,你已经成功在本地跑起了自己的 AI 模型。
常见问题(翻车自救指南)
Q:双击启动.bat 后窗口一闪就没了
A:最常见的两个原因——
- 模型路径不对:检查
models文件夹里是不是真的有.gguf文件
- 模型路径不对:检查
- 编码没选 ANSI:重新按第五步操作,另存为时选 ANSI
Q:加载到一半报显存不足
A:换成更小的量化版本。把 Q4_K_M 改成 Q3_K_M(虽然效果差一点但能跑)。
Q:下载太慢
A:确认你已经设置了 HF_ENDPOINT=https://hf-mirror.com,走国内镜像会快很多。
Q:回答全是重复的话
A:这是采样参数问题。打开 启动.bat,在命令后面加上参数:
1 | `llama-server.exe -m models/Qwythos-9B-Claude-Mythos-5-1M-Q4_K_M.gguf --host 0.0.0.0 --port 8080 -ngl 99 --temp 0.6 --repeat-penalty 1.05` |
Q:Mac 电脑能不能跑?
A:能。下载 llama.cpp 的 macOS 版本,命令基本一样,把 llama-server.exe 换成 ./llama-server。
进阶:在 VS Code 里用这个模型(就到这步很酷了)
如果你是开发者,想让 Qwythos-9B 在 VS Code 里帮你写代码:
1. 确保模型正在运行(黑色窗口开着,显示 listening on http://127.0.0.1:8080)
2. 装一个叫 Continue 的 VS Code 插件
3. 在 Continue 的设置里,选择 “Local Provider” → “llama.cpp”
4. 填上地址:http://127.0.0.1:8080
搞定。它就是你的本地 AI 编程助手了。
觉得这篇教程帮到了你,帮阿永做三件事:
点赞,让更多想入门本地模型的朋友看到这篇傻瓜式教程。
在看,转发给也在研究怎么部署 AI 的群友。
关注数字生命阿永,我会持续输出大模型评测、部署教程的第一手干货。
评论区聊聊:你按照步骤跑通了吗?卡在哪一步?我来帮你解决。
相关链接汇总(直接复制):
- • Python 下载:https://www.python.org/downloads/
- • llama.cpp 下载:https://github.com/ggml-org/llama.cpp/releases
- • 魔搭社区模型页:https://modelscope.cn/models/empero-ai/Qwythos-9B-Claude-Mythos-5-1M
- • GGUF 镜像下载:huggingface-cli download empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF –local-dir ./models
- • VS Code Continue 插件:https://marketplace.visualstudio.com/items?itemName=Continue.continue
本文转载自微信公众号,如有侵权请联系删除。
- 标题: 手把手教你!国内免费部署 Qwythos-9B,4G 显存就能跑 Claude 5 级推理
- 作者: lxiol
- 创建于 : 2026-07-06 10:48:37
- 更新于 : 2026-07-06 10:48:37
- 链接: https://blog.lxiol.cn/2026/07/06/手把手教你国内免费部署-Qwythos-9B4G-显存就能跑-Claude-5-级推理/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。