Qwythos-9B 开源推理模型发布:百万 Token 上下文 + 4GB 显存可部署,推理能力媲美顶级闭源模型
Qwythos-9B 开源推理模型发布:百万 Token 上下文 + 4GB 显存可部署,推理能力媲美顶级闭源模型
最近开源 AI 模型的迭代速度真是越来越快了。前两天一款叫 Qwythos-9B-Claude-Mythos-5-1M 的新开源推理模型悄悄上线,很快就吸引了大批本地 AI 玩家的注意。
和其他开源模型不同的是,Qwythos-9B 最受关注的地方在于它用大量来自高端闭源模型的推理数据进行训练,通过专门的后训练方法把这些推理能力压缩到了一个只有 9B 参数的开源模型里。
更让人意外的是,它不仅支持超过 104 万 Token 的超长上下文,还提供了 GGUF 量化版本,最低 4GB 显存就能在本地跑起来。
那这款被不少人称为"开源推理新秀"的模型到底怎么样?这篇文章就来详细聊聊。
Qwythos-9B 是个什么样的模型?
Qwythos-9B 是基于 Qwen3.5-9B 架构做了全参数训练的推理模型。
Empero AI 团队在深度未审查版的 Qwen3.5-9B 基础上,用超过 5 亿条高质量推理轨迹做了后训练。这些数据主要来自 Anthropic 最顶尖的推理模型,包含完整的思维链(Chain of Thought)推理过程,由 Empero AI 内部的 rethink 系统自动生成。
简单概括就是:
把一个顶级闭源大模型的推理思维方式,迁移到了一个仅有 9B 参数的开源模型里。
最终做出了一个在推理能力、部署成本和长上下文方面都很有特色的新开源模型。
本地部署需要什么配置?
Qwythos 已经提供了 GGUF 格式,可以用以下工具直接跑:
- llama.cpp / llama-server
- OpenWebUI
- Cherry Studio
- OpenClaw
不同量化版本对应的显存需求如下:
| 显存 | 推荐量化 |
|---|---|
| 4GB | Q4_K_M |
| 6GB | Q5_K_M |
| 8GB | Q6_K |
| 12GB | Q8_K_M |
| 16GB | BF16 |
| 24GB | MTP-BF16 |
如果要用 BF16 全精度版本,建议至少准备 24GB 显存。
部署步骤
第一步:下载模型
前往 Huggingface 下载,或者从 夸克网盘 下载打包好的文件。
第二步:安装 llama.cpp
可以从 GitHub 官方仓库 下载,或者用 备用链接、网盘链接(里面带了启动脚本)。
第三步:一键启动脚本
也可以直接复制下面的代码保存为 BAT 文件:
@echo off
setlocal EnableDelayedExpansion
chcp 936 >nul
title LingDu AI - Qwythos Launcher
color 0A
cd /d "%~dp0"
:: =====================================================
:: 自动查找模型
:: =====================================================
set MODEL=
set MMPROJ=
for %%F in (models\Qwythos*.gguf) do (
echo %%~nxF | find /I "mmproj" >nul
if errorlevel 1 (
set MODEL=%%F
)
)
for %%F in (models\mmproj*.gguf) do (
set MMPROJ=%%F
)
:MENU
cls
echo.
echo ============================================================
echo.
echo LingDu AI - Qwythos Launcher
echo.
echo Claude Mythos 5 Distilled Vision Model
echo.
echo ============================================================
echo.
if defined MODEL (
echo Model Found:
echo !MODEL!
) else (
echo Model Found:
echo NOT FOUND
)
echo.
if defined MMPROJ (
echo Vision Projector:
echo !MMPROJ!
) else (
echo Vision Projector:
echo NOT FOUND
)
echo.
echo ============================================================
echo.
echo Select Your GPU VRAM
echo.
echo [1] 4GB VRAM
echo Recommended Context: 16K
echo.
echo [2] 6GB VRAM
echo Recommended Context: 32K
echo.
echo [3] 8GB VRAM
echo Recommended Context: 64K
echo.
echo [4] 12GB VRAM
echo Recommended Context: 128K
echo.
echo [5] 16GB VRAM
echo Recommended Context: 256K
echo.
echo [6] 24GB VRAM
echo Recommended Context: 512K
echo.
echo ------------------------------------------------------------
echo.
echo OpenAI Compatible API
echo.
echo http://127.0.0.1:8080/v1
echo.
echo ------------------------------------------------------------
echo.
echo Supported Clients
echo.
echo OpenWebUI
echo Cherry Studio
echo Claude Code
echo OpenAI Codex
echo OpenClaw
echo.
echo ------------------------------------------------------------
echo.
echo [0] Exit
echo.
echo ============================================================
set /p choice=Select Option:
if "%choice%"=="1" (
set CTX=16384
set MODE=4GB
goto START
)
if "%choice%"=="2" (
set CTX=32768
set MODE=6GB
goto START
)
if "%choice%"=="3" (
set CTX=65536
set MODE=8GB
goto START
)
if "%choice%"=="4" (
set CTX=131072
set MODE=12GB
goto START
)
if "%choice%"=="5" (
set CTX=262144
set MODE=16GB
goto START
)
if "%choice%"=="6" (
set CTX=524288
set MODE=24GB
goto START
)
if "%choice%"=="0" exit
goto MENU
:START
cls
echo.
echo ============================================================
echo.
echo Starting Qwythos...
echo.
echo Mode:
echo %MODE%
echo.
echo Context:
echo %CTX%
echo.
echo Model:
echo !MODEL!
echo.
echo Vision:
echo !MMPROJ!
echo.
echo API:
echo http://127.0.0.1:8080/v1
echo.
echo ============================================================
echo.
if not defined MODEL (
echo ERROR:
echo No Qwythos model found in models folder.
echo.
pause
goto MENU
)
if not defined MMPROJ (
echo WARNING:
echo No mmproj found.
echo Starting as text-only model.
echo.
llama-server.exe ^
-m "!MODEL!" ^
-ngl 999 ^
-c %CTX% ^
-n 8192 ^
-fa on ^
--cont-batching ^
--host 127.0.0.1 ^
--port 8080
pause
goto MENU
)
llama-server.exe ^
-m "!MODEL!" ^
--mmproj "!MMPROJ!" ^
-ngl 999 ^
-c %CTX% ^
-n 8192 ^
-fa on ^
--cont-batching ^
--host 127.0.0.1 ^
--port 8080
pause
goto MENU
下载后解压,在根目录新建一个 models 文件夹,把模型文件放进去就行了。
官方公布的性能提升
根据 Empero AI 公布的测试数据,Qwythos 相比原始 Qwen3.5-9B 在几项基准测试中都有明显提升。
MMLU(知识理解)
这项测试衡量模型的知识理解和应用能力。
相比基础模型提升了 +34 分
GSM8K Strict(数学推理)
考察数学计算和推理能力。
提升了 +30 分
GSM8K Flex(复杂逻辑推理)
更灵活的数学与逻辑推理测试。
提升了 +19 分
对只有 9B 参数的模型来说,这个提升幅度确实很厉害。
最大的卖点:104 万 Token 上下文
Qwythos 最让人眼前一亮的其实不是跑分。
而是它默认开启了 YaRN 长上下文扩展,开箱就能支持:
1,048,576 Token
换算过来就是:
104 万 Token
什么水平呢?一般大模型通常只支持 8K、32K、64K 或者 128K 的上下文窗口。
而 Qwythos 理论上可以处理:
- 一整个项目的代码库
- 超长的学术论文
- 好几本电子书
- 长时间运行的 AI Agent 工作流
对程序员来说,可以直接把整个项目丢进去分析。做研究的可以一次性处理大量文献。玩 AI Agent 的则意味着更长的记忆和更复杂的任务能力。
原生 Function Calling
除了推理能力,Qwythos 还兼容 Qwen3.5 标准的原生 Function Calling,也就是说:
- 不用额外装插件
- 不用做微调
- 不用额外封装
就能直接调用各种外部工具,比如:
- Python 执行器
- 网页搜索
- 数据分析工具
- Agent 系统
官方测试表明,接上工具后 Qwythos 能实现自我验证和自我纠错,答案准确率有明显提升。
视觉识别也支持
目前官方已经发布了视觉版本,包含:
- Qwythos-9B-Claude-Mythos-5-1M 主模型
- mmproj-Qwythos-9B-Claude-Mythos-5-1M-F16 视觉投影文件
部署后可以用来看图、做 OCR 文字识别、分析图表、理解界面截图,还能做多模态问答。对于本地 AI 玩家来说,不用联网就能获得基础的视觉能力。
实际用起来怎么样?
简单体验了一下,Qwythos 的推理风格和那些顶级闭源模型很接近。具体来说:
- 推理过程更完整,会一步步拆解问题
- 逻辑链条清晰,每一步都有依据
- 长文本分析能力不错
- 调用工具时比较稳定
特别是在复杂逻辑推理和代码生成场景中,明显比同级别的其他 9B 模型要强。
当然,104 万 Token 更多是理论上的上限,对大多数用户来说,32K 到 128K 的上下文已经完全够用了。
总结
Qwythos-9B-Claude-Mythos-5-1M 可以说是近期最值得关注的开源推理模型之一。它把顶级闭源模型的推理能力带到了 9B 这个规模,同时还提供了:
- 104 万 Token 超长上下文
- 原生 Function Calling
- 多模态视觉能力
- GGUF 格式方便本地部署
- 最低 4GB 显存就能跑
如果你在找一个推理能力强、上下文长、还能本地部署的开源模型,Qwythos-9B 值得一试。
后面我会继续测试它在代码生成、AI Agent、长文本分析等实际场景中的表现,感兴趣的话可以关注后续更新。