本文来自微信公众号: 业界良新 ,作者:许良
开篇:涨价的冲击
8月17日零点,DeepSeek新价格正式生效。
-
V4 Pro高峰时段输出:6元→27元/百万Token,涨350%
-
缓存命中输入:0.025元→0.3元,涨了12倍
-
峰谷定价:高峰9:00-12:00、14:00-18:00,空闲半价
那个曾经”浓眉大眼”把API打到白菜价的”价格屠夫”,”叛变””AGI革命”了,曾被尊称为”梁圣”的梁文锋,如今被叫做”梁子”,更被很多人戏称为”梁文谷”,因为高峰时段太贵了,根本用不起。
同一周,阿里开源了Qwen3.8-27B。
全球社区在疯狂关注同一个问题:能不能用家里的消费级显卡部署这个模型,实现Token自由?社区的一句话引起共鸣:”Qwen 3.8 is having a DeepSeek moment。”
第一部分:模型本身有多强
这不只是一个”能用”的模型
参数规模27B,但性能指标追平旗舰级别。
第三方榜单Artificial Analysis给出52分,追平DeepSeek V4 Flash(284B参数),超过所有40B-150B的中型模型。这背后是test time scaling的威力:靠更长思考链换更强表现。
看下这张图——横轴是参数规模(对数刻度),纵轴是智能得分:

Qwen3.8-27B卡在了异常位置:用最小的参数量达到了旗舰级性能。同分数的GLM-5.2参数量是它的几十倍。被称为”甜点位”——这正是这一周社区疯狂的原因。
成本效率上,它还在帕累托前沿
但真正值得关注的,是成本效率这个维度。
Artificial Analysis最近发布的代理任务成本效率对标图中,Qwen3.8-27B正好卡在帕累托前沿——同等成本下得分最高、同等得分下成本最低。每个任务约$0.5成本、51分得分。

对比来看:
-
Claude Opus 5:$6/task得到59分,效率不在帕累托线上
-
从27B往上跳:GLM-5.3 Max要$1.5/task才能到59分,Grok-4.6要$2/task,GPT-5.6 Sol要$3/task。每多得1分,成本几乎翻倍。
关键点来了:用消费级显卡本地部署27B,你拿到的不只是一个”能用”的模型——你拿到的是成本效率帕累托前沿上的模型。和DeepSeek V4 Flash、V4 Pro一起,代表了当前AI推理最有效率的一条线。
第二部分:怎么塞进消费级显卡
显存方案:从BF16到W4A16
社区方案(主要基于syv-ai仓库)的做法很直接:
-
取W4A16量化权重(社区已有的4-bit权重、16-bit激活)
-
二次量化lm_head、embed_tokens和MTP草案模块到int8/int4
-
配合vLLM补丁,把模型、草案和KV cache控制在单卡24GB内
实测例子(hankin的验证机):模型加KV cache共占约22.3GB,可跑64K上下文。
速度跃升的关键:投机解码
这才是这套方案的核心。投机解码怎么工作?
-
让一个轻量”草案器”先猜接下来若干个token
-
主模型一次性验证这批猜测
-
猜对的采纳,猜错的重来
关键是:验证一批token的成本远低于逐个生成,而且目标模型对每个token都做完整验证——输出分布与不投机时完全一致。速度的收益不以改变输出为代价。
性能对标:从46到381 tok/s
这套方案把投机解码用到了什么程度?实测阶梯:
不开投机(基线):46 tok/s+MTP草案头优化:118 tok/s+DFlash2块草案器:132 tok/s+上下文lookup起草:133 tok/s(聊天提示词)+验证块扩到16 token:381 tok/s(25K文档复现场景)
381这个数字需要单独说清。DFlash2训练时每次只提7个草案,但作者发现验证块不必与草案数对齐:如果模型的回答本来就在大量引用prompt里已有的文档(RAG问答、按指示改写、代码助手),那剩余验证位置可以用上下文出现的token直接填充——这些”草案”零成本,命中率极高。在25K文档复现上,每个验证步平均接受15/16个token,速度从260→382 tok/s。
所以381不是普适速度。普通聊天提示词下,同一套配置约133 tok/s。
可复现性:2.28×加速被验证
独立开发者hankin在另一台机器、另一张3090上复现了这套方案,用自己的10个写作提示词做严格的开关A/B:
| 配置 | 吞吐 | 首token延迟 |
|---|---|---|
| MTP关闭 | 52.7 tok/s | 几乎无变化 |
| MTP开启 | 120.0 tok/s | – |
| 提升倍数 | 2.28× | – |
这个数字落在仓库标称的波动区间内。关键是:方案的核心收益在独立机器上可以复现。2.28×加速可重现。

质量代价:可测且小
把BF16模型量化到4-bit再叠加多层int8/int4,代价是什么?hankin的实测(这套权重+vLLM 0.27.1+MTP配置):
| 测试 | 结果 | 说明 |
|---|---|---|
| HumanEval(164题,思考关) | 92.7% | 代码生成未见明显异常 |
| IFEval可验证子集(40题,思考关) | 80.0% | 指令遵循未见明显异常 |
| GSM8K(60题,思考开) | 91.7% | 已完成项为98.2% |
结论:在已测试范围内,没有观察到明显的基础能力退化。
但这不等于”证明无损”。hankin自己强调:没做完整的同协议A/B(BF16 vs W4A16 vs关闭投机)。未测过的任务区间(长链条代码重构、小语言、多模态)无法保证。

第三部分:体验和隐藏的坑
配置门槛速查表
27B模型4-bit量化后约15-17GB。不同显存的体验差异很大:
| 显存规格 | 体验评价 | 备注 |
|---|---|---|
| 24GB(RTX 3090/4090/5090) | 富余 | 模型+KV cache 22.3GB,可跑64K上下文,单流120+tok/s |
| 16GB(RTX 5080/5070Ti) | 能跑 | 上下文受限,日常对话/代码编辑没问题 |
| 12GB(RTX 4070 Ti) | 勉强 | Q3量化约14.4GB,体验打折明显 |
| Mac M5 Max | 可观 | 实测40+tok/s |
这周有个热搜词:”4090能部署什么大模型””小显存部署大模型”。问这种问题的已经不是极客,是被DeepSeek涨价困扰的开发者。
真实能干什么
跑分之外,社区用户的实际使用场景更说明问题。
Reddit本月有个高赞帖(799赞):单张3090,普通量化版。给模型一个凭证和大学名,它自己穿过层层校园网站拉出课表——零人工干预,执行了80次工具调用。还有人让它自己下载视频、抽帧”看”内容、装Whisper跑转录。
X上也出现很多新帖子:”stopped paying for AI coding today”——今天起,停掉AI编程订阅。这些不是概念验证,是已经在跑的实际工作流。
三条清晰的边界
1.并发上限是硬的
服务最大序列数8:
-
1路聚合:94.8 tok/s
-
8路:180.4 tok/s
-
16路:还是180.4 tok/s(但首token等待从5.0秒涨到11.4秒)
建议:把活跃推理并发控制在8以内,等待队列放在服务外部。
2.长上下文首token成本不能忽略
Prefill速度约1,000 tok/s,TTFT随输入长度线性上涨:
-
128 token输入:0.61秒
-
32K输入:29秒
-
60K输入:59秒
-
64K返回HTTP 400(服务不崩)
结论:64K不是”不能跑”,而是要接受长文档场景接近一分钟的首响应时间。提示词压缩、分块检索、前缀缓存,仍然比盲目塞满64K重要。
3.Prefix caching的收益被严重低估
同一份25K文档的第二次提问,首token时间从22.4秒降到0.56秒,答案逐token不变。对”加载一次文档、反复提问”的场景(RAG、代码助手),这个收益比吞吐数字更直接决定体验。
真正的坑:思考档位”不肯收尾”
这是这次独立验收里最有价值的发现。
Qwen3.8默认开启思考模式,且reasoning_effort默认是xhigh。hankin观察到:模型持续推理,但迟迟不给最终答案。
在12K输出预算下:
-
GPQA-Diamond:总准确率55%,43%的题打满预算没有最终答案
-
AIME 2026:总准确率43.3%,57%的题没有在预算内结束
把预算放宽到24K,两项分别回升到72%和60%——但仍有24%和37%的题不收敛。
关键在于定性:这些”未完成”大多不是重复死循环,模型仍在换元、验证、分类讨论——推理过程是健康的,只是不肯进入收尾阶段。对已经收敛的题,GPQA-D和AIME的条件准确率分别是93.4%和94.7%。模型会做,但它不交卷。
调低思考档位呢?hankin做了15题的探索性配对(5道GSM8K、5道GPQA、5道AIME,每题分别跑xhigh和medium):
| 档位 | 准确率 | 输出token中位数 |
|---|---|---|
| xhigh | 11/15(73.3%) | 3,599 |
| medium | 14/15(93.3%) | 1,457 |
Medium的成本不到xhigh一半,准确率反而更高。
这个样本很小(hankin自己强调:15题、每题每档只采样一次),结论不该推广。但指向很实用:在你的真实负载上,默认xhigh未必是更好的默认值;medium作为试运行起点,性价比大概率更高。
第四部分:对开发者的建议
三类适合入场
1.重度用户
每天都在跑编程agent、批量文档、自动化流水线,API月账单已经上千。一块二手24GB卡几个月回本。本地部署对他们不是”省钱”,是”把成本从不可控变成可控”。
2.隐私刚需
公司数据不能出门、内部代码不能上云。开源27B是唯一够得着的”旗舰平替”——参数规模足够大,效果足够好,部署门槛足够低。
3.喜欢折腾的
这一周社区有人提交240K上下文优化、有人自己做KV cache代理、有人移植到AMD和华为NPU——玩的就是过程。对他们,部署本身就是价值。
两类人建议冷静
1.轻度用户
偶尔写文案、问问题——涨价后一年多花的钱,可能不够一张3090的一半。Token自由的投入产出比,对轻度用户算不过来。
2.想”一劳永逸”的
硬件会过时、模型月月换代。买卡买的是当下,不是永久。V2EX四月就有人提醒:”两个月后出了40-60B新模型,你的硬件就跑不动了。”
拼卡陷阱:预算砍太狠会很难受
低预算方案的体验可能差一个量级。有用户为省钱用双RTX 5060 Ti 16G凑显存跑27B:
-
实测只有23 tok/s
-
原因:位宽太小+双卡通讯损耗
显存够不等于体验好——位宽、通讯带宽、单卡vs双卡,都会让同一个模型在不同硬件上差出一个量级的体验。
成本结构分析
这不是”零成本”的生意。
据业内人士:微调验证用本地卡;真正的线上推理,买卡的经济性普遍不划算。DGX Spark两台一年亏3万;单卡5090跑满24小时一年赚3万(批发模式,不等于自用)。
但混合策略可能有戏:
-
日常轻量用API
-
重活、私事、自动化放本地
-
Token自由的本质不是零成本,而是多一个选项
投入前的检查清单
如果想在自己的消费级显卡上试,这是务实的投入策略:
-
思考请求默认reasoning_effort=medium,最难的任务允许一次受控重试
-
活跃并发不超过8,队列留在应用层
-
长文档优先检索和压缩,别把64K当免费容量
-
区分负载类型:贪心写作、采样思考、长上下文,不要用一个吞吐数字代表所有场景
-
把当前部署视为”功能候选”,而不是通过长期稳定性验收的生产版本
最后一句话
速度的军备竞赛已经打到381 tok/s,消费级显卡部署大模型已经从”能不能”进入”好不好”的中段。这套方案对普通用户仍非开箱即用——模型下载、再量化、打补丁、Docker或venv,一条都不少。
但对愿意折腾的人,一张二手老旗舰加上一个Apache-2.0的仓库,此刻能换来的本地推理体验,在一年前是不可想象的。
务实的姿势是:日常轻量用API,重活、私事、自动化放本地。
Token自由的本质不是零成本,而是多一个选项。
