loading

Loading

请输入关键字开始搜索
    首页 AI专栏AI 前哨系列

    Qwen3.8-27B评测:MoE之外的Dense路线 | 本地部署完整指南

    字数: (9882)
    阅读: (847)
    1

    1 背景

    这两天随便打开一个技术群、X、小红书,满屏都是 Qwen3.8-27B。我手边没有单卡 80G 的机器,没法立刻拉下来跑一轮自己的 benchmark,但这不妨碍把它从架构、科普、部署、实测到趋势一次性捋清楚。毕竟评测不是只有"我亲自跑了"这一种写法,把别人跑出来的数和官方卡摆在一起,照样能看明白。

    这周圈子里被 Qwen3.8-27B 刷屏刷到反胃。同期智谱在 6 月放的 GLM-5.2(753B 的后训练对话版)几乎没溅起水花。并不是它不行,是 753B 只能挂云端,普通人摸不着。大家兴奋的点出奇一致:不是"又出了一个更大的",而是"这个我能搬回家自己跑"。

    这里有个反常识的细节值得先点出来:Qwen 这一代其实同时发了更大的 Qwen3.8-2.4T-A95B——总参数 2.4 万亿、激活 95B 的 MoE 巨兽。但刷屏的不是它,是 27B。原因可以归纳成一句话:

    大模型真正的分水岭不在参数天花板,而在能不能搬回家。

    2.4T 那个只能挂云端,普通玩家摸不着;27B 这个量化一下能塞进一张消费级显卡。所以本文就围绕这个"能搬回家"的 27B 展开。

    2 Qwen3.8-27B 到底是个什么模型

    2.1 关键参数一表看清

    项目 数值 说明
    参数量 27B(约 280 亿) 稠密模型,全参数激活
    架构 Dense(非 MoE) Gated DeltaNet + Gated Attention 混合,64 层
    精度 BF16(原版)/ FP8(量化版) FP8 block size 128,近乎无损
    模态 Image-Text-to-Text 原生支持图像 + 视频理解
    上下文 原生 262,144(256K) YaRN 可扩到 1,000,000
    思考模式 可开关 reasoning_effort 调 xhigh/medium/low
    License Apache-2.0 商用友好
    发布 2026 年 8 月 HF 下载量已破百万

    几个注意点:

    • Gated DeltaNet + Gated Attention 混合架构。这不是纯 Transformer,而是把线性注意力(DeltaNet)和标准注意力按 16:1 的比例混着用。好处是长上下文省显存,256K 原生上下文能落地,架构本身功不可没。
    • 原生多模态。支持图文、视频,这点对本地玩家很关键:一个模型顶过去"语言模型 + 视觉模型"两套,比如DeepSeek和GLM因为都只支持文本模型,在问答、Agent支持上还需要单独对接一个视觉模型,兼容性不好。
    • 思考模式可关。默认开思考,按请求关;还能用 reasoning_effort 调推理深度。等于一个模型既能当快思考的对话助手,也能当慢思考的推理机。

    2.2 为什么这次火的是 27B,不是 2.4T

    把同代两个型号摆一起,逻辑就清楚了:

    型号 总参 激活 架构 谁能跑
    Qwen3.8-27B 27B 27B Dense 量化后单张消费级/专业卡
    Qwen3.8-2.4T-A95B 2.4T 95B MoE 云端集群,普通人摸不到
    GLM-5.2(智谱同期) 753B —(未公布) MoE 云端,普通人摸不到

    MoE 的坑就在这:总参 2.4T 听着吓人,激活 95B 看着也还行,但所有专家的权重都得载进显存,如果不量化的话,大概需要 4800G显存(大概需要60 个 H100 显卡,每张 80G 显存),就算是量化到INT4,也需要1200GB显存(大概15 个 H100)。激活省的是算力不是显存。结果就是算得动,但装不下。普通人根本没机会本地部署,自然没"火花"。

    27B Dense 反过来:参数不大,全激活,量化到 INT4 权重只要约 14GB,一张 RTX 4090/5090 就能塞下。能被普通人亲手跑起来的模型,才有刷屏的资格。

    3 科普扫盲:跑一个大模型到底在烧什么

    有很多同学可能还不太清楚大模型的一些基本词汇,这里给没怎么碰过本地部署的同学补底子。很多人看到"27B、FP8、MoE、vLLM"就头大,其实拆开就四件事:精度、架构、引擎、显存。

    3.1 模型精度:BF16 / FP8 / INT4 差在哪

    精度就是"每个参数用多少 bit 存"。bit 越少,显存越省,但精度损失越大。

    精度 bit 相对显存 质量损失 谁在用
    BF16 16 100% 无(训练原生) 训练、专业卡推理
    FP8 8 ~50% 近乎无损 H100 等新卡、官方量化
    INT4(AWQ/GPTQ) 4 ~25% 轻微 消费级主流
    GGUF Q4_K_M ~4.5 ~28% 轻微 llama.cpp,CPU/GPU 通吃

    经验法则:BF16 是原汁原味,FP8 是性价比之王,INT4 是消费级的救命稻草。Qwen3.8-27B 官方直接给了 FP8 版,且声明性能与原版几乎一致——对本地玩家来说,FP8 就是首选,不用自己再量化。

    那是不是越省越好?

    不是。显存省的是空间,质量亏的是脑子。可以想象一下,一个参数,如果是BF16,则是用65535的长度表示,如果是INT4,那只有128来表示,量化以后,以小模型检测为例,人形位置可能会波动,精度损失在闲聊里看不出,在硬任务上肉眼可见:

    任务类型 INT4 相对 BF16 的表现
    闲聊 / 翻译 / 总结 几乎无差别
    数学多步推理 误差累积,末位答案易错
    写代码 边界条件、变量名小错变多
    长上下文(>32K) 越往后越丢细节、混淆
    指令遵循(输出 JSON 等) 格式遵循率下降

    总结:
    1)简单任务看不出,硬任务见真章。闲聊 INT4 和 BF16 没区别,但跑 SWE-bench 那种真实改代码,分数会掉几个点。
    2)量化方法决定损失下限。AWQ/GPTQ 是"聪明量化",护住关键权重;暴力 RTN 四舍五入损失最大。GGUF Q4_K_M 是混合精度(重要层多给 bit),所以比纯 INT4 稳——这也是它平均 ~4.5bit 而非纯 4bit 的原因。
    3)官方量化 > 社区量化。Qwen3.8-27B 的 FP8 是官方调过的,敏感层(attention 等)保高精度,所以敢说"几乎无损";INT4 多半是社区后做的,没官方背书,质量看具体仓库。

    所以选型是道匹配题:闲聊翻译省事用 INT4,代码数学跑 Agent 用 FP8,做基准评测要原汁原味用 BF16。Qwen3.8-27B 官方把 FP8 这道甜点做好了,本地玩家没理由不先用,INT4 是 24G 消费卡装不下 FP8 时的退路,不是首选。

    3.2 Dense 还是 MoE,凭什么 Dense 这次赢麻了

    先把两个词说人话:内存 vs 显存

    很多人混着用"内存"和"显存",本地部署里这俩天差地别。

    1)内存(RAM):电脑主板上那根内存条,容量大、便宜、但慢。常见 16/32/64GB,CPU 使用,一般通过PCIE连接。
    2)显存(VRAM):焊在显卡上的专用存储,容量小、贵、但极快。游戏卡 8–24GB,专业卡 48/80GB;一张 RTX 4090 的 24GB 显存就要一万多,H100 的 80GB 显存十万级。GPU 用它。

    大模型推理主要靠 GPU 现炒现卖,所以模型权重必须放进显存里,不是内存。你内存插到 256GB 也没用,因为GPU 从内存取数据要绕 PCIe 走,慢几十倍,等于让大厨跑仓库拿料,菜早凉了。

    一句话
    内存是大仓库,显存是灶台。模型推理要现炒现卖,料必须在灶台上,放仓库里现搬来不及。

    这就是为什么本地玩家盯着显存看、不看内存——显存比内存金贵十倍,也小十倍,这才是真正的瓶颈。

    Dense 和 MoE 到底差在哪

    • Dense:一个全才医生,所有本事都在脑子里。看任何一个病人,全部知识一起上。27B 参数全在显存里,用多少占多少,简单粗暴。
    • MoE:一座医院,养着上百个专科专家。每次看病只请其中几个出诊,所以"激活"小、算得快。但问题是:所有专家都得在医院里候着,因为来什么病人事先不知道,专科医生不能临时叫。结果就是激活省了、驻留没省。

    一句话记住:MoE 省的是算力(出诊的人少),不省显存(候诊的人一个没少)。

    为什么 MoE 在本地放不下

    拿这次同代的两个型号算笔账(BF16,每参数 2 字节):

    型号 总参 全部权重占显存 单卡 80G 要几张 普通人够得着吗
    Qwen3.8-27B 27B ~54GB 1 张 量化后 4090 能跑
    Qwen3.8-2.4T-A95B 2.4T ~4800GB 约 60 张 想都别想

    2.4T 的坑就在这:就算每次只激活 95B(出诊的医生少),2.4T 全部权重(所有医生)都得驻留显存,2.4万亿 × 2 字节 ≈ 4800GB。单张卡 80GB,要 60 张才装得下,这不是个人玩家的事,是数据中心的事。激活小只让它算得动,没让它装得下。

    算力 vs 显存,哪个是生死线

    本地部署有两条约束,分量完全不同:
    1)算力不够:推理慢,每秒吐 5 个字。能忍,等就是了。
    2)显存不够:直接 OOM(out of memory),模型压根加载不进来,一个字都吐不出来。直接出局。

    所以本地化第一关是"装得下",不是"跑得快"。本地化的天敌不是算力不够,是显存装不下。这就是 27B Dense 能火、2.4T MoE 火不起来的根因——27B 量化后塞进一张消费卡,2.4T 量化十倍也还是数据中心专属。

    但"Dense 赢 MoE"只在独显场景成立
    上面说的是独显(显存=小容量 VRAM)的情况。换到统一内存一体机(DGX Spark / Mac Studio / AMD Ryzen AI Max+395,显存=内存、容量上百 GB),结论反过来:中等 MoE(如激活 5.1B 的 Ling-3.0-flash)激活小、读得少,反而比 Dense 快得多——实测单机 35 tok/s vs 27B Dense 的 4.37 tok/s(详见 5.2)。一句话:独显小显存选 Dense,大统一内存选 MoE。

    3.3 推理引擎:vLLM / SGLang / llama.cpp 怎么选

    引擎 定位 核心优化 适合场景
    vLLM 高吞吐服务 PagedAttention 多并发 API、生产服务
    SGLang 复杂应用 RadixAttention + 复杂调度 Agent、多轮、结构化输出
    llama.cpp CPU+GPU 混合 GGUF 量化 消费级、单机、离线
    Transformers 研究 无特殊优化 调试、改模型

    一句话选型:要对外服务选 vLLM,要跑 Agent 选 SGLang,只有一张游戏卡选 llama.cpp,要改模型本身才上 Transformers。

    3.4 显存占用:27B 到底要吃多少卡

    下面这张表是我按"权重显存 = 参数量 × 每参数字节"算的理论值,再加 KV cache 余量估的(实际还看上下文长度和并发):

    精度 27B 权重显存 典型硬件 本地可行性
    BF16 ~54GB H100 / A100 80G 单卡 需专业卡
    FP8(官方) ~27GB RTX 5090 32G / L40S 48G 5090 或专业卡
    INT4(AWQ/GPTQ) ~14GB RTX 4090 24G 消费级 ✓
    GGUF Q4_K_M 17.77GB 4090 24G 或 32G 内存 消费级 ✓

    注意 FP8 的尴尬:27GB 权重对大多数消费卡偏大。但有个特例——RTX 5090 是 32GB GDDR7,是消费级里唯一能装下官方 FP8(27GB)、跑近乎无损精度的卡。4090(24GB)装不下 FP8,得退到 INT4 或 GGUF。这个细节很多刷屏帖没讲清,容易让人按老经验以为消费卡都只能 INT4。

    4 怎么部署:HuggingFace 和魔塔社区两条路

    4.1 拉模型

    国内推荐走魔塔社区(ModelScope),速度快不用梯子;海外或要最新版走 HuggingFace。

    HuggingFace:

    pip install -U "huggingface_hub[cli]"
    huggingface-cli download Qwen/Qwen3.8-27B-FP8 --local-dir ./Qwen3.8-27B-FP8

    魔塔社区(ModelScope):

    pip install modelscope
    modelscope download --model qwen/Qwen3.8-27B-FP8 --local_dir ./Qwen3.8-27B-FP8

    先下 FP8 还是 BF16?
    本地玩家直接下 Qwen3.8-27B-FP8。BF16 原版 54GB 起步,没专业卡别折腾;FP8 官方量化、近乎无损、还自带各引擎示例,性价比最高。

    4.2 起服务

    vLLM(最常用,OpenAI 兼容 API):

    pip install vllm
    vllm serve "Qwen/Qwen3.8-27B-FP8"

    调用:

    curl -X POST "http://localhost:8000/v1/chat/completions" \
      -H "Content-Type: application/json" \
      --data '{"model": "Qwen/Qwen3.8-27B-FP8", "messages": [{"role": "user", "content": "用一句话介绍你自己"}]}'

    SGLang(跑 Agent / 复杂调度):

    pip install sglang
    python3 -m sglang.launch_server --model-path "Qwen/Qwen3.8-27B-FP8" --host 0.0.0.0 --port 30000

    Transformers(调试 / 研究):

    from transformers import pipeline
    pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.8-27B-FP8")
    messages = [
        {"role": "user", "content": [
            {"type": "image", "url": "https://example.com/photo.jpg"},
            {"type": "text", "text": "这张图里是什么?"}
        ]}
    ]
    print(pipe(text=messages))

    推理参数官方也给了建议,直接抄:

    • 思考模式:temperature=1.0, top_p=0.95, top_k=20
    • 非思考模式:temperature=0.7, top_p=0.80, presence_penalty=1.5

    4.3 消费级硬件的退路:GGUF 量化

    只有一张消费卡(4090 24G / 5090 32G)或干脆纯 CPU 跑,就走 llama.cpp + GGUF。GGUF 版通常由社区(如 bartowski、unsloth)出,命令:

    # 拉社区 GGUF(具体仓库名以 ModelScope/HF 搜索为准)
    huggingface-cli download bartowski/Qwen3.8-27B-GGUF --include "*Q4_K_M*" --local-dir ./gguf
    
    # 起服务
    ./llama-server -m Qwen3.8-27B-Q4_K_M.gguf -ngl 99 -c 32768 --port 8080

    -ngl 99 把层全卸到 GPU,-c 32768 给上下文。纯 CPU 就把 -ngl 调小甚至 0,靠内存扛,慢,但能跑。

    5 实际测试:能力与速度的数据

    5.1 官方基准(有出处,含横向对比)

    数据来源:HuggingFace Qwen/Qwen3.8-27B 官方模型卡。

    基准 Qwen3.8-27B Qwen3.6-27B Opus4.6 Max 这个数代表什么
    SWE-bench Pro 61.7 53.5 53.4 真实软件工程任务修复率
    LiveCodeBench v6 90.3 83.9 88.8 实时编程题
    GPQA Diamond 89.2 87.8 91.3 研究生级科学问答
    OSWorld-Verified 84.3 63.9 72.7 操作系统级 Agent 任务
    AndroidWorld 81.9 70.3 62.0 安卓 Agent 任务
    MathVision(with CI) 94.6 视觉数学题

    几个直观解读:
    1)SWE-bench Pro 61.7 不只是真能改代码——它把闭源的 Opus4.6 Max(53.4)按在地上摩擦。27B 开源反超闭源旗舰,放两年前不敢想。
    2)OSWorld-Verified 84.3AndroidWorld 81.9 说明它能当 Agent 操作电脑和手机,这是官方强调"长期代理任务"的底气,且远超上一代 27B(63.9 / 70.3)。
    3)MathVision 94.6 印证多模态不是噱头,看图做数学题接近满分。
    4)唯一没拿第一的是 GPQA Diamond(89.2 vs Opus 91.3),科学推理还差闭源一点——但差距已经很小。

    5.2 实测数据:真实 DGX Spark 基准

    数据来源
    本节数据引自 Lonely__MH《大模型本地部署完整指南》(2026-08-17)。原文主角是蚂蚁百灵 Ling-3.0-flash,Qwen3.8-27B 作为参照模型进行单机压测。我提取了 Qwen3.8-27B 的关键数字,并结合我的带宽分析加以解读。

    硬件与模型配置

    项目 配置
    硬件 NVIDIA DGX Spark(GB10 芯片,121.6GB 统一内存
    架构 ARM64 + Ubuntu 24.04
    引擎 vLLM(BF16 全精度)
    模型 Qwen3.8-27B Dense BF16

    实测吞吐与延迟

    并发数 聚合吞吐 单路吐字速率 平均首字延迟(TTFT) P95 首字延迟
    c=1 4.34 tok/s 4.37 tok/s 294.8 ms 297.5 ms
    c=2 8.55 tok/s 4.32 tok/s 540.0 ms 626.5 ms
    c=4 16.84 tok/s 4.26 tok/s 658.2 ms 694.3 ms
    c=8 32.61 tok/s 4.15 tok/s 1033.5 ms 1085.4 ms

    为什么只有 4 tok/s?带宽是罪魁祸首

    原文原文一句话点破天机:

    55.6GB 权重访存瓶颈——由于 Qwen3.8-27B 为 27.8B 全激活全精度模型,每步解码需搬运全部 55.6 GB 权重,受限于单机内存带宽,其吞吐构成了衡量 MoE 稀疏能效比的黄金基线。

    这个 4.37 tok/s 和我前面的带宽公式完全对上:

    • 55.6 ÷ 4.37 ≈ 12.7 TB/s(并发后有效带宽)
    • 单并发时,DGX Spark 的统一内存带宽(~几百 GB/s)远低独显,被 BF16 全量压垮,所以只有 4 tok/s。

    这印证了我的判断:低带宽 + BF16 = 极慢,MoE 激活小是优势(Ling-3.0-flash 单并发 35 tok/s,是 Qwen3.8-27B 的 8 倍)。

    给本地玩家的启示

    1)DGX Spark 是"能装下"但"不算快"。121.6GB 统一内存能塞下 BF16,但带宽被统一内存拖垮,decode 慢。适合"能跑、不用等"的离线任务,不适合实时对话。

    2)MoE 在统一内存上反而赢麻了。Ling-3.0-flash(124B 总参,5.1B 激活)单机 35 tok/s,是 Qwen3.8-27B 的 8 倍,这验证了我第 3.2 节的判断:MoE 省算力不省显存,但在"显存就是内存"的统一内存机器上,激活小直接转化为快

    3)消费级玩家别指望 BF16。想快要么上高带宽独显(5090 的 FP8,~85 tok/s 理论值),要么走 MoE 路线。

    6 趋势预判:大模型本地化这件事,已经不可逆了

    把时间线拉长看,这件事其实不新鲜。历史反复在演同一个剧本:

    1990 年代,计算机是机房里的大家伙,普通人摸不到。后来 PC 普及,算力搬进了家。
    2010 年代,智能语音、图像识别都在云端。后来手机 NPU 起来,端侧能跑了。
    2026 年,大模型正站在同一个拐点上——从"只能调 API"到"能塞进一张显卡"。

    Qwen3.8-27B 刷屏,本质是这个拐点到了的信号弹。几条具体判断:

    1)27B 会成为本地部署的甜点档。再小(7B 级)能力不够看,再大(70B+)消费级装不下,27B 量化后正好卡在 24G 卡的舒适区。
    2)电脑的下一个标配可能是"能跑大模型的显卡"。就像当年独立显卡为了游戏普及,下一轮可能是为了本地大模型。买电脑看显存会变成常识。
    3)统一内存一体机会兴起,MoE 在一体机上翻盘。DGX Spark、Mac Studio、AMD Ryzen AI Max+395 这类"显存=内存"的一体机正在普及——容量上百 GB,装得下 124B 的 MoE。这时激活小的 MoE 反而比 Dense 快(实测 Ling-3.0-flash 35 tok/s 是 27B Dense 的 8 倍)。独显小显存看 Dense,统一内存大容量看 MoE,两种硬件走两条路。
    4)多模态原生会成为默认形态。单独下个语言模型再接视觉模块的拼装路线,会被"一个模型全吃"的原生多模态替代——Qwen3.8-27B 就是这个形态的样本。

    ==大模型本地化不是要不要做的问题,是哪台电脑先装上的问题。==

    风险 / 注意事项

    1)显存别只看参数。27B 听着不大,BF16 要 54GB,FP8 要 27GB——4090 24G 跑 FP8 会 OOM,但 5090 32G 刚好能装。买卡前先按第 3.4 节算一遍。
    2)长上下文吃 KV cache。256K 上下文很香,但真开到那么长,KV cache 显存会暴涨,并发和长度得取舍。
    3)GGUF 版本滞后。社区量化通常比官方慢半拍,要最新版还是得盯 HF/ModelScope 官方。
    4)第三方实测要自己跑。刷屏帖里的速度数硬件各异,照搬没意义,拉下来用 vLLM 自带 benchmark 跑一遍才是自己的数。
    5)License 确认。Qwen3.8-27B 是 Apache-2.0 商用友好,但衍生量化版的 License 以各自仓库为准,商用前看一眼。

    本文发布于2026年08月19日21:00,已经过了31天,若内容或图片失效,请留言反馈
    文章出处: 求索空间
    文章链接: https://blog.askerlab.com/qwen3_8_27b_review
    评论列表:
    empty

    暂无评论