5M token 上下文!256 个专家!SILX AI 开源 18B 模型 Quasar-Preview
SILX AI 在 Hugging Face 上架了一个叫 Quasar-Preview 的开源模型,总参数 18B 但每次推理只激活 2B,上下文窗口却配了 500 万 token,足足是当前主流百万级模型的 5 倍
SILX AI 在 Hugging Face 上架了一个叫 Quasar-Preview 的开源模型,

总参数 18B 但每次推理只激活 2B,
上下文窗口却配了 500 万 token,足足是当前主流百万级模型的 5 倍,
里面还塞进了循环 Transformer、三合一混合注意力、外部 n-gram 记忆模块等,
这些通常只出现在学术论文设想里的东西,被一股脑塞进了同一个开源模型里。
500 万 token 的上下文窗口是最吸引眼球的,
配置文件确实把最大序列长度写到了 500 万,但模型卡紧接着就给出了一个关键限定:
长上下文路径目前只接受了不到 10 亿 token 的扩展训练,

这个训练量对于解锁 500 万 token 的可用上下文来说远远不够,整个配置被明确标注为实验性质。
要理解 Quasar-Preview 的长上下文策略,需要先了解一个背景知识:
当前主流模型使用的位置编码方案叫旋转位置编码(简称 RoPE),
它通过给每个位置赋予一组旋转角度来帮助模型区分 token 的先后顺序。
当序列长度被拉到几百万时,这些旋转角度会被极度拉伸,位置之间的区分度急剧下降,模型的注意力就会变得混乱。
Quasar-Preview 给出的方案叫 Safe NoPE:
前 512 个位置保留正常的旋转位置编码来维持精确的近端感知,从第 513 个位置开始直接切换为无位置编码模式,

也就是说远距离的 token 不再附带任何位置信息,模型只靠内容本身的关联性来建立远距离依赖。
这个思路背后的直觉其实不难理解:
近距离的 token 需要精确知道彼此的前后关系,而远处的 token 更重要的是「能被看到」而不是「排在第几位」。
与其让旋转位置编码在超长距离上过度拉伸变成噪声,不如干脆把这个信号拿掉,
让模型自己在后续训练中学会在无位置信息条件下的远距离关联能力。
Quasar-Preview 是混合专家模型,也就是业界常说的 MoE。
普通密集模型处理每个 token 时都要让全部参数参与计算,
而 MoE 的做法是内置多个专家子网络,由一个路由器决定每个 token 交给哪几个专家处理,
从而在保持模型总知识容量的同时大幅压缩单次推理的计算开销。

这就是 Quasar-Preview 的实际运行方式:
配置文件显示它总共有 256 个专家,每个 token 激活其中 8 个,
外加 1 个所有 token 共享的常驻专家,总参数约 18B,
但每次前向传播实际参与计算的参数只有大约 2B,相当于总参数量的九分之一。
但 Quasar-Preview 并不只是把 MoE 做大了,它在注意力层上也动了大刀子。
模型的 20 层网络从第 4 层开始进入一个混合注意力循环,每 5 层为一组,

在这之上,模型还搭了一个叫「循环 Transformer」的执行框架。
传统 Transformer 每一层只执行一次就把结果传给下一层,而循环 Transformer 允许某些层的输出重新作为输入再跑一轮,
类似于程序里的循环结构,理论上能让模型在不增加参数量的情况下获得更深的推理能力。
另一个值得单独说的组件是 Engram 记忆模块,

这是一个独立于标准神经网络权重之外的外部记忆机制,
它会把输入中的 token 序列模式存入一块额外的记忆空间,在需要时检索出来辅助当前推理。
模型卡给出了 9 项基准测试的早期快照数据:

这些数字需要放在两个前提下理解:
第一,模型每次推理只激活约 2B 参数,在这个激活规模下 MATH-500 拿到 71.4% 说明数学推理能力并不弱。
第二,它只是一个预览版检查点,GPQA 的 25.6% 和 MMLU-Pro 的 33.2% 清楚地表明在需要深度推理的任务上还有相当大的提升空间。
这些分数只是当前检查点谱系的快照,需要公开复现才能确认可靠性,
并且实际表现会受到测试框架、提示词格式、示例数量、解码策略以及检查点版本等多种因素影响。
今天的分享就到这里。
觉得有用的话,欢迎点赞、分享、关注。

我们下篇文章见。
参考资料:
https://huggingface.co/silx-ai/Quasar-Preview
https://huggingface.co/silx-ai/Quasar-Preview/raw/main/config.json
https://huggingface.co/silx-ai/Quasar-3B-A1B-Preview
[

本文转载自微信公众号,如有侵权请联系删除。
- 标题: 5M token 上下文!256 个专家!SILX AI 开源 18B 模型 Quasar-Preview
- 作者: lxiol
- 创建于 : 2026-06-20 01:24:58
- 更新于 : 2026-06-20 01:24:58
- 链接: https://blog.lxiol.cn/2026/06/20/5M-token-上下文256-个专家SILX-AI-开源-18B-模型-Quasar-Preview/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。