【深度拆解】单卡 4090 把大模型从 20 跑到 184 token/s:一条本地推理加速的完整路线图

拆解日期:2026-06-25 视频作者:小天fotos(抖音)| 时长:约 18 分钟 | 平台:抖音 标签:#qwen36 #turboquant #dflash #deepseekv4 双轨来源:SenseVoice 音频逐字稿 + 豆包视觉逐帧画面分析


刷到一条很「硬」的视频:屏幕左右两半,左边双卡 4090,右边单卡 4090,同时跑刚发布的 Qwen3.6 27B,比谁先吐完一段字。这种「赛马式开头」你以为是讲硬件,看下去才发现,真正的主角不是卡,是一整套把同一张卡的速度榨出 5 到 10 倍的优化手法

作者一句话定了调:他认为 Qwen3.6 27B 是个里程碑时刻——本地模型第一次真正具备「核弹级生产力」。而这条视频值钱的地方,是他把「从 20 token/s 一路优化到 184 token/s」的完整路径,一站一站讲清楚了,每一站用的是什么技术、提速多少、代价是什么,全有实测数字。

这篇就把这条推理加速路线图拆到能照着走,并补上视频里点到为止、但决定你要不要照做的底层逻辑。

一句话定性

这是一条**「技术盘点 + 实测复盘」型视频**:选题踩在「Qwen3.6 27B + 全网极客都在优化它」这个正热的点上,主体是一条可复现的优化阶梯——量化 → MTP → DFlash → TurboQuant,配上自己跑的几十份测试报告。它不卖工具、不卖课,卖的是「你的显卡到底是玩具还是核弹级生产力工具,取决于你会不会优化」这个认知。教程属性 + 硬件投资观点兼具。

先搞清楚:为什么基础速度只有 20 token/s

起点是最朴素的一组配置:一个 27B 的稠密模型,FP8 精度,单卡 4090,什么都不优化直接跑。

结果是 20 token/s

这个速度有多难受?作者的类比很传神:你让它写段程序,它函数名才敲一半,你已经受不了想自己写了。但要注意,FP8 的精度几乎无损,慢不是因为它笨,是因为算力被浪费了。

核心瓶颈一句话:现在 GPU 的算力远大于显存的访问速度。卡算得飞快,但数据从显存搬过来跟不上。尤其 4090 这种非高带宽显存的卡,「等数据」就是它最大的时间黑洞。

理解了这个瓶颈,后面所有优化就都顺了——它们本质都在干一件事:要么让搬运的数据更少,要么让 GPU 等数据的空档别闲着。

优化阶梯:四站,从 20 到 184

先把全程数字摆成一张表,这是整条视频的骨架(单卡 4090 为主):

站点技术单卡 4090 速度相对起点
起点FP8 不优化20 token/s
第一站4bit 量化(AWQ/GGUF)45–48 token/s~2.4×
第二站量化 + MTP(N=5)108 token/s~5×
第三站DFlash + DDtree平均 141 / 峰值 184 token/s~7–9×
贯穿TurboQuant(KV cache 量化)解决显存瓶颈,让上面都跑得起来

下面逐站拆。

第一站 · 量化:用一丢丢精度换一倍速度

第一刀砍向数据量本身:4bit 量化,把模型权重从 16 位压到 4 位,体积直接小 4 倍。

为什么体积小就快?回到那个瓶颈——卡卡在「搬数据」。同样的带宽,4bit 要搬的数据比 FP8 少一半,速度自然快一倍。

量化有两条主流路线,选哪条取决于你一个人用还是高并发用

  • GGUF(配 llama.cpp):作者最常用 Q4KM,大小和精度的平衡点。还有 unsloth 的动态量化,精度损失更小,可以按显存预算选 Q4/Q5/Q6/Q8。缺点是不为高并发设计,适合一个人用;显存不够时还能把一部分 offload 到内存。
  • AWQ(配 vLLM):同样 4bit,但 vLLM 天生为高并发设计,适合你要同时跑多个请求的场景。

实测:llama.cpp 的 Q4 约 45 token/s,vLLM 的 AWQ 约 48 token/s。光换个量化方式,就从 20 翻倍到 40 多。

精度代价呢?作者很坦诚地「叠了个甲」:测试不算严谨,用别人的工具、3 个数据集、45 个场景(取自最近很火的、对比工具调用成功率的 toolcall 测试集里的数据提取和指令遵循两项)。结论是大部分场景你基本感受不到损失,无非多一点点错误、多一点纠错。考虑到速度翻倍多,这点损失完全可接受。

第一站的判断:想快速提速,量化是第一选择。尤其当你显存受限时,量化决定的不是快不快,是能不能跑起来。

第二站 · MTP:让摸鱼的 GPU 顺手多干一票

量化之后作者不满足。下一招叫 MTP(Multi Token Prediction,多 token 预测),属于投机解码的一种。

什么叫「投机」?正常解码是一个字一个字蹦。MTP 给模型多接几个预测头,一次同时猜后面好几个 token,再一次性验证,对的留下、错的丢掉。N=1 就是同时猜 1 个,N=5 就是同时猜 5 个。

为什么这能加速?又回到瓶颈:单 token 生成时,GPU 大部分时间在摸鱼等数据。MTP 相当于趁它等的工夫硬塞个活,把白白浪费的算力捞回来。实测数字很夸张:

  • AWQ 路线:不开 MTP 48 → N=1 是 71(+49%)→ N=3 是 99(+106%)→ N=5 是 108(+124%)
  • FP8 路线:不开 MTP 20 → N=1 是 38(+90%)→ N=3 是 60(+200%)→ N=5 是 72。FP8 提升更猛,因为 int 运算要转浮点,而 4090 有 FP8 硬件优化。

一句话:从 FP8 的 20,到 AWQ + MTP,单卡直接翻了 5 倍到 108。(llama.cpp 也支持投机解码,用的是 Ngram 方式,但作者实测对「每次都是全新上下文」的场景提升不明显,它更适合多轮连续上下文。)

插一段最值钱的认知 · 双卡、高并发与「极致的杠杆」

这里作者岔开讲了一段,对真正想拿本地模型干活的人来说,可能比速度数字更重要

他借了套双卡系统测:双卡 FP8 + MTP(N=5) 单并发能到 120 token/s——比单卡只多 10 个。第二张卡是不是浪费?别急

  1. 单并发提升小是有原因的:单并发时双卡瓶颈不在算力,而在两张卡同步权重的通信损耗。4090 没有 P2P 通信,数据要绕一遍 CPU 和内存,损耗很大。
  2. 第二张卡真正的价值在高并发:当你同时跑 10 个甚至更多请求,单卡就力不从心了,双卡吞吐量大得多。作者的比喻:从双车道开上四车道,一个人开 120 没区别,但车一多就豁然开朗。

然后他抛出一个概念——「极致的杠杆」

低级的杠杆,是用本地模型加一点电费换一些生产力。极致的杠杆,是用同样的卡、同样的算力、差不多的电耗,通过优化把 token 产出提升几十倍

他自己做了一套多 agent 编排系统,让好几个本地 agent 同时干活(他特别提到喜欢用 Claude Code 的 agent teams 开多个 agent 协作)。逻辑是:高智商模型做复杂规划/编排,差一点但能高并发的模型去干重复体力活。而这套玩法能跑起来的前提,就是「有一个本地能高并发的模型」——现在 Qwen3.6 27B 把这个前提补上了。

这段对老大这种「lead 派 worker」的多 agent 玩家是直接对口的:本地高并发模型 + 编排,是把单卡价值放大几十倍的真正杠杆点。

第三站 · DFlash + DDtree:从「猜一条线」到「铺一片森林」

MTP 已经很强,但作者指出它的局限:它是串行的,一条线猜 5 个字,虽然比一个字蹦快,但还是沿着单一路径走。

DFlash 是今年新出炉、全网框架都在抢着支持的东西,思路完全不同——它借用了 AI 生图的扩散模型思想:

AI 生图是先生成一张模糊的图,再一步步去噪让它变清晰。DFlash 把这套用在文本上:先一次性生成一小块模糊的候选文本,再反复打磨直到概率清晰。扩散模型天生就是并行运算的好手。

但 DFlash 还不是终点,上面还有一层 DDtree(Diffusion Draft Tree)。MTP 是一次猜 5 个连成单条路径,DFlash 默认也还是把生成的 token 连成一条单路径交给大模型验证——一旦中间一个 token 错了,后面全白费。DDtree 不一样:

它先用扩散生成一小块备选文字,然后同时探索多条路径(作者配的参数是 22,即 22 条备选路径一起下注),只要有一条走通就成功。一句话——先用扩散铺出一整片森林,再一次性找到最佳路线。

威力多大?有个叫 loosebox 的项目,在一块 3090 上把 Qwen3.6 27B 从 37 token/s 硬标到 207 token/s。作者自己单卡 4090 没那么极致,但平均能到 141峰值 184 token/s

不过他给了句实话:DFlash 的速度上下浮动、有随机性,加速效果跟任务类型强相关。他实测同样 DFlash:

  • 数学题 150 token/s:逻辑死板,除了数字就是公式符号,顺着公式一猜一个准。
  • 写代码 120 token/s:缩进括号好猜,但代码里无数自定义变量/函数名(小模型猜 userId、大模型想要 userAccount),中间错一个后面全废,自由度拉低了命中率。
  • 创意写作最难:「春风吹过……」后面能接的地方太多了,作者直接建议:拿它写东西别用投机解码,没效果。

好消息是:我们最常用的多 agent、Claude Code 写代码这类场景,恰恰是最适合投机解码的任务之一。

贯穿全程 · TurboQuant:把显存这道墙也砸了

最后压轴的是 TurboQuant,它解决的是另一个维度——显存

前面说的量化是压权重。TurboQuant 压的是 KV cache:从 FP16 压到 3–4 比特,压缩比接近 4 倍,精度损失可忽略。作者特意强调:这不是权重量化,是 KV cache 量化。

为什么这是大事?过去几乎没人敢量化 KV cache,因为那是灾难性的质量损失。现在质量不掉、又能压 4 倍,意味着:

一块 3090 24G 跑一个 Q4 的模型,还能有 200K 的上下文。 vLLM 最新的 0.20 已经支持,loosebox 也支持了。

这一步的意义是把「24G 显存」从一个硬天花板,变成了能跑生产级长上下文的可用配置。

一条没明说但很硬的副线:显卡是资产,会升值

视频里反复出现一个反直觉的观点:作者去年买的 4090 48G,用了一年现在反而更贵了,他还预测 3090 也会涨价。

逻辑链是这样的:

  1. 优化让老卡重新值钱。多少年前的 3090,靠 DFlash 居然能跑到 200 token/s——它怎么可能不升值?
  2. 大量功耗其实浪费在调度和等待上,不是真算。loosebox 做了个实验:把一个小模型在 3090 上、把 24 层网络融合成一个 CUDA kernel,不断优化能效比,甚至把 3090 降功率到很低,能效比能追平 Apple M5 Max。这说明 N 卡和 Apple Silicon 的差距,很多是软件层面的问题,不是硬件天花板
  3. 所以结论:本地算力会随着这种优化不断升值。买卡不是消费,是投资,卡是资产。

作者自己的 4090 去年买时只能跑通义 2.5、妥妥的玩具,现在已经能本地高并发跑生产级模型——同一张卡,价值变了。

落到你身上:到底该怎么用

视频信息密度很高,把它收敛成可执行的判断:

1. 你显存多大,决定你站在哪一站。

  • 24G(含单 4090/3090):能跑。走 Q4 量化 + TurboQuant,靠 KV cache 量化撑起长上下文。作者原话——「如果你有 24G 显存,即使不订阅 coding plan,也绝不会被这个世界淘汰」。
  • 48G / 96G:你拥有的是一个「本地数据中心级」的天才,可以认真做高并发编排。

2. 追生产稳定,别上来就追峰值。 DFlash 虽然能冲 184,但作者明确点了它现在的限制:不支持多并发、没合并进 llama.cpp 主线、用 Claude Code 时工具调用经常断。他自己生产环境用的是 FP8 + vLLM + MTP——精度最高、支持多并发,约 10 个并发能到约 500 token/s 总吞吐。追峰值用 DFlash,追稳定用 FP8+vLLM+MTP,分清场景。

3. 按任务类型选要不要投机解码。 写代码 / 多 agent / 工具调用 → 上投机解码(MTP/DFlash),收益最大;创意写作 → 别用,没效果。

4. 真正的杠杆不是「跑得快」,是「跑得多」。 单纯把单条速度从 20 提到 184 是一层价值;把它接进多 agent 编排、让多个本地模型同时干活,才是把单卡价值放大几十倍的「极致杠杆」。这一点,对在本地搞 agent 协作的人尤其值钱。

可复制的优化决策骨架

把这条路线抽象成一个可以照着走的清单:

第 0 步 · 摸清瓶颈:你的卡通常卡在「显存带宽」而非算力 → 优化目标 = 减少搬运 + 填满空档
第 1 步 · 量化(必做):4bit。一个人用走 GGUF Q4KM(llama.cpp);要高并发走 AWQ(vLLM)
第 2 步 · 投机解码:开 MTP,N 从 1 往上加,看你任务的命中率收益(代码/工具调用收益高)
第 3 步 · 上限探索:试 DFlash + DDtree(多路径),冲峰值;但接受它的随机性和不稳定
第 4 步 · 解显存:开 TurboQuant 量化 KV cache,换长上下文 / 更大并发
分场景 · 生产稳定走 FP8+vLLM+MTP;写作类任务关掉投机解码
终局   · 把高并发模型接进多 agent 编排 = 极致杠杆

橙子的判断

这条视频的硬核之处不在某个单点技术,而在它把「本地推理优化」这件原本散落在各个 repo、issue 和论文里的事,串成了一条有数字、有顺序、有取舍的完整路线。三个我认为最值得记住的判断:

  • 优化的本质是「填空档」,不是「换更强的卡」。从 20 到 184,靠的全是量化、投机解码、KV cache 量化这些软件手段,卡一张没换。这意味着会优化的人和不会的人,用同一张卡能差出近 10 倍
  • 追峰值和追生产是两件事。184 是 demo 数字,500 总吞吐(FP8+vLLM+MTP 多并发)才是能投产的数字。对要拿模型干活的人,后者更重要。
  • 本地高并发模型 + 多 agent 编排,是 2026 年最被低估的杠杆。作者反复回到这个点不是偶然——单条速度只是入场券,编排才是把算力变成生产力的乘法器。

一句话收尾:别只盯着「我的卡能跑多快」,要盯「我能让它同时干多少活」。 推理优化让显卡从玩具变成生产力,而编排,才是把这份生产力放大成数据中心的那一步。