手把手教你!国内免费部署 Qwythos-9B,4G 显存就能跑 Claude 5 级推理

lxiol

原文链接:https://mp.weixin.qq.com/s/yNLowBJjEc7nvJsSYsfvEg

不管你是学生、设计师、还是第一次接触本地模型的纯小白,照着这篇一定能跑起来。

大家好,我是阿永。

很多朋友看了我之前那篇 Qwythos-9B 的评测,在后台问我:

“阿永,我完全不懂编程,怎么跑起来?”
“有没有不需要翻墙的下载方法?”
“4G 显存的笔记本能不能搞?”

今天这篇就是专门写给你们的。

全程大白话,带图带步骤,跟着点鼠标就行。

不管你是学生、设计师、还是第一次接触本地模型的纯小白,照着这篇一定能跑起来。

Qwythos-9B 本地部署教程封面

Qwythos-9B 本地部署教程封面

先搞清楚这是啥

Qwythos-9B 是一个可以在你自己电脑上运行的 AI 模型

它相当于把 Claude 5 的”脑子”提取出来,塞进了一个 9B 的小模型里。

跟 ChatGPT 的区别:

  • • 不用联网,断网也能用
  • • 不用付费,电费就是全部成本
  • • 没有审查,你让它写啥就写啥(当然请合法使用)
  • • 数据不出你的电脑,隐私安全

需要的硬件:

最低 4GB 显存(NVIDIA 显卡),也就是大部分笔记本电脑都有的配置。

准备工作:先装 Python

如果电脑已经装了 Python,跳过这一步。

第一步:下载 Python

打开浏览器,访问:
https://www.python.org/downloads/

点那个大大的黄色 “Download Python 3.10.x” 按钮。

第二步:安装 Python

下载完双击安装包。

下面这一步非常重要:

在安装界面最底部,有一个勾选框叫 “Add Python to PATH”

一定要打勾。

然后点 “Install Now”,等着装完就行。

第一步:安装下载工具

这一步只需要一行命令。

Windows 用户

按下键盘上的 Win + R,输入 cmd,回车。

在弹出的黑色窗口里,输入下面这行命令,按回车:

1
`pip install modelscope`

等它跑完,出现一大串文字最后显示 Successfully installed,就成功了。

在 CMD 中安装 modelscope

在 CMD 中安装 modelscope

第二步:下载模型(国内高速通道)

这里给两种下载方式,小白推荐方案二(GGUF 版),文件小、速度快。

方案一:下载完整版(适合服务器、大显存用户)

在刚才的黑色窗口里,输入:

1
`modelscope download --model empero-ai/Qwythos-9B-Claude-Mythos-5-1M --local_dir ./models`

这个命令会从阿里云魔搭社区下载,速度飞快,不需要翻墙。

方案二:下载 GGUF 轻量版(适合大部分个人电脑,推荐)

先设置镜像源(让下载走国内通道),输入:

1
`set HF_ENDPOINT=https://hf-mirror.com`

然后输入:

1
`huggingface-cli download empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF --local-dir ./models`

等进度条跑到 100% 就下好了。

下载完成后,你会在 ./models 文件夹里看到好几个 GGUF 文件。

选哪个?

文件名

大小

你的显卡

推荐

Q4_K_M

5.24 GB

4GB - 6GB

首选,大部分笔记本都能跑

Q5_K_M

6.02 GB

6GB - 8GB

质量和速度平衡

Q6_K

6.85 GB

8GB - 12GB

质量更好

Q8_0

8.87 GB

12GB 以上

接近无损,效果最好

第一次尝试,建议直接下 Q4_K_M,跑通了再换大的。

第三步:下载 llama.cpp(运行模型的核心程序)

打开浏览器,访问:

https://github.com/ggml-org/llama.cpp/releases

往下翻,找到最新版本的 Assets 区域。

找到这个文件(选你的系统):

  • • Windows + NVIDIA 显卡llama-b3583-bin-win-cuda-cu12.6.7z
  • • Windows 普通版llama-b3583-bin-win-avx2-x64.7z

点击下载,得到一个 .7z 压缩包。

下载完解压到你的 D盘 或者 E盘,比如 D:\llama.cpp\

第四步:整理文件夹结构

这一步非常重要,不要搞乱路径

在 D:\llama.cpp(就是刚才解压出来的文件夹)里面,新建一个文件夹,叫 models

然后把刚才下载的 GGUF 模型文件(那个 .gguf 文件)复制或移动到 models 文件夹里。

最后结构应该是这样:

1
2
3
4
`D:\llama.cpp\
  ├── llama-server.exe         ← 核心程序
  ├── models\                    ← 新建的文件夹
  │   └── Qwythos-9B-Claude-Mythos-5-1M-Q4_K_M.gguf  ← 模型文件`

文件夹目录结构示意

文件夹目录结构示意

第五步:创建启动脚本

这一步是小白最容易翻车的地方,注意看红字提醒

在 D:\llama.cpp 文件夹里面,右键 → 新建 → 文本文档

把下面这行代码复制进去:

1
`llama-server.exe -m models/Qwythos-9B-Claude-Mythos-5-1M-Q4_K_M.gguf --host 0.0.0.0 --port 8080 -ngl 99`

然后点 文件 → 另存为

关键来了:

在”另存为”窗口里:

    1. 文件名输入:启动.bat
  • 2. 编码选择:ANSI(重要!选错会乱码闪退)
    1. 保存类型选:所有文件
    1. 点击保存

记事本另存为选 ANSI 编码

记事本另存为选 ANSI 编码
保存后,文件夹里会出现一个 启动.bat 文件。

第六步:启动模型(见证奇迹的时刻)

如果你的显卡是 4GB-6GB:直接用上面那个 启动.bat 就行。

如果你的显卡是 8GB-12GB:右键 启动.bat → 编辑,把 Q4_K_M 改成 Q6_K 或 Q8_0

如果你的显卡是 24GB 以上:可以跑完整版模型了。

双击 启动.bat

会弹出一个黑色窗口,开始哗哗地滚代码。

看到这行字就说明成功了:

1
2
`llama_server: model loaded
listening on http://127.0.0.1:8080`

启动成功的终端窗口

启动成功的终端窗口

第七步:打开浏览器,开始聊天

保持那个黑色窗口不要关

打开你的浏览器(Chrome、Edge 都行),在地址栏输入:

1
`http://127.0.0.1:8080`

回车,你会看到一个聊天界面。

在输入框里打字,模型就会回答你。

浏览器中的 Qwythos-9B 聊天界面

浏览器中的 Qwythos-9B 聊天界面
到这里,你已经成功在本地跑起了自己的 AI 模型。

常见问题(翻车自救指南)

Q:双击启动.bat 后窗口一闪就没了

A:最常见的两个原因——

    1. 模型路径不对:检查 models 文件夹里是不是真的有 .gguf 文件
    1. 编码没选 ANSI:重新按第五步操作,另存为时选 ANSI

Q:加载到一半报显存不足

A:换成更小的量化版本。把 Q4_K_M 改成 Q3_K_M(虽然效果差一点但能跑)。

Q:下载太慢

A:确认你已经设置了 HF_ENDPOINT=https://hf-mirror.com,走国内镜像会快很多。

Q:回答全是重复的话

A:这是采样参数问题。打开 启动.bat,在命令后面加上参数:

1
`llama-server.exe -m models/Qwythos-9B-Claude-Mythos-5-1M-Q4_K_M.gguf --host 0.0.0.0 --port 8080 -ngl 99 --temp 0.6 --repeat-penalty 1.05`

Q:Mac 电脑能不能跑?

A:能。下载 llama.cpp 的 macOS 版本,命令基本一样,把 llama-server.exe 换成 ./llama-server

进阶:在 VS Code 里用这个模型(就到这步很酷了)

如果你是开发者,想让 Qwythos-9B 在 VS Code 里帮你写代码:

1. 确保模型正在运行(黑色窗口开着,显示 listening on http://127.0.0.1:8080

2. 装一个叫 Continue 的 VS Code 插件

3. 在 Continue 的设置里,选择 “Local Provider” → “llama.cpp”

4. 填上地址:http://127.0.0.1:8080

搞定。它就是你的本地 AI 编程助手了。

觉得这篇教程帮到了你,帮阿永做三件事:

点赞,让更多想入门本地模型的朋友看到这篇傻瓜式教程。

在看,转发给也在研究怎么部署 AI 的群友。

关注数字生命阿永,我会持续输出大模型评测、部署教程的第一手干货。

评论区聊聊:你按照步骤跑通了吗?卡在哪一步?我来帮你解决。

相关链接汇总(直接复制):

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: 手把手教你!国内免费部署 Qwythos-9B,4G 显存就能跑 Claude 5 级推理
  • 作者: lxiol
  • 创建于 : 2026-07-06 10:48:37
  • 更新于 : 2026-07-06 10:48:37
  • 链接: https://blog.lxiol.cn/2026/07/06/手把手教你国内免费部署-Qwythos-9B4G-显存就能跑-Claude-5-级推理/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。