茉莉花
新闻网
2026-08-24 · 星期一近12小时收录 50 条最近更新 11:22

快讯AI医疗市场破1500亿元 巨头资本竞逐赛道

27B模型追平旗舰性能 消费级显卡实现Token自由

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
虎嗅网
原文作者
许良©
原文发布
本站收录

本文来自微信公众号: 业界良新 ,作者:许良

开篇:涨价的冲击

8月17日零点,DeepSeek新价格正式生效。

  • V4 Pro高峰时段输出:6元→27元/百万Token,涨350%

  • 缓存命中输入:0.025元→0.3元,涨了12倍

  • 峰谷定价:高峰9:00-12:00、14:00-18:00,空闲半价

那个曾经”浓眉大眼”把API打到白菜价的”价格屠夫”,”叛变””AGI革命”了,曾被尊称为”梁圣”的梁文锋,如今被叫做”梁子”,更被很多人戏称为”梁文谷”,因为高峰时段太贵了,根本用不起。

同一周,阿里开源了Qwen3.8-27B。

全球社区在疯狂关注同一个问题:能不能用家里的消费级显卡部署这个模型,实现Token自由?社区的一句话引起共鸣:”Qwen 3.8 is having a DeepSeek moment。”

第一部分:模型本身有多强

这不只是一个”能用”的模型

参数规模27B,但性能指标追平旗舰级别。

第三方榜单Artificial Analysis给出52分,追平DeepSeek V4 Flash(284B参数),超过所有40B-150B的中型模型。这背后是test time scaling的威力:靠更长思考链换更强表现。

看下这张图——横轴是参数规模(对数刻度),纵轴是智能得分:

9cd7e9e835a696bb8bd105ea8dde5ee12145912ee039a7244b62d3d78450ec6c article

Qwen3.8-27B卡在了异常位置:用最小的参数量达到了旗舰级性能。同分数的GLM-5.2参数量是它的几十倍。被称为”甜点位”——这正是这一周社区疯狂的原因。

成本效率上,它还在帕累托前沿

但真正值得关注的,是成本效率这个维度。

Artificial Analysis最近发布的代理任务成本效率对标图中,Qwen3.8-27B正好卡在帕累托前沿——同等成本下得分最高、同等得分下成本最低。每个任务约$0.5成本、51分得分。

e470531c352164c49bcde21bbb104e0f432bd707f5529fa3984257e47fc6f43b article

对比来看:

  • Claude Opus 5:$6/task得到59分,效率不在帕累托线上

  • 从27B往上跳:GLM-5.3 Max要$1.5/task才能到59分,Grok-4.6要$2/task,GPT-5.6 Sol要$3/task。每多得1分,成本几乎翻倍。

关键点来了:用消费级显卡本地部署27B,你拿到的不只是一个”能用”的模型——你拿到的是成本效率帕累托前沿上的模型。和DeepSeek V4 Flash、V4 Pro一起,代表了当前AI推理最有效率的一条线。

第二部分:怎么塞进消费级显卡

显存方案:从BF16到W4A16

社区方案(主要基于syv-ai仓库)的做法很直接:

  1. 取W4A16量化权重(社区已有的4-bit权重、16-bit激活)

  2. 二次量化lm_head、embed_tokens和MTP草案模块到int8/int4

  3. 配合vLLM补丁,把模型、草案和KV cache控制在单卡24GB内

实测例子(hankin的验证机):模型加KV cache共占约22.3GB,可跑64K上下文。

速度跃升的关键:投机解码

这才是这套方案的核心。投机解码怎么工作?

  • 让一个轻量”草案器”先猜接下来若干个token

  • 主模型一次性验证这批猜测

  • 猜对的采纳,猜错的重来

关键是:验证一批token的成本远低于逐个生成,而且目标模型对每个token都做完整验证——输出分布与不投机时完全一致。速度的收益不以改变输出为代价。

性能对标:从46到381 tok/s

这套方案把投机解码用到了什么程度?实测阶梯:

不开投机(基线):46 tok/s+MTP草案头优化:118 tok/s+DFlash2块草案器:132 tok/s+上下文lookup起草:133 tok/s(聊天提示词)+验证块扩到16 token:381 tok/s(25K文档复现场景)

381这个数字需要单独说清。DFlash2训练时每次只提7个草案,但作者发现验证块不必与草案数对齐:如果模型的回答本来就在大量引用prompt里已有的文档(RAG问答、按指示改写、代码助手),那剩余验证位置可以用上下文出现的token直接填充——这些”草案”零成本,命中率极高。在25K文档复现上,每个验证步平均接受15/16个token,速度从260→382 tok/s。

所以381不是普适速度。普通聊天提示词下,同一套配置约133 tok/s。

可复现性:2.28×加速被验证

独立开发者hankin在另一台机器、另一张3090上复现了这套方案,用自己的10个写作提示词做严格的开关A/B:

配置 吞吐 首token延迟
MTP关闭 52.7 tok/s 几乎无变化
MTP开启 120.0 tok/s
提升倍数 2.28×

这个数字落在仓库标称的波动区间内。关键是:方案的核心收益在独立机器上可以复现。2.28×加速可重现。

2f5581ec12bea81040b888833d2a6407c75970d26f42c04b6015a7948a7538dc article

质量代价:可测且小

把BF16模型量化到4-bit再叠加多层int8/int4,代价是什么?hankin的实测(这套权重+vLLM 0.27.1+MTP配置):

测试 结果 说明
HumanEval(164题,思考关) 92.7% 代码生成未见明显异常
IFEval可验证子集(40题,思考关) 80.0% 指令遵循未见明显异常
GSM8K(60题,思考开) 91.7% 已完成项为98.2%

结论:在已测试范围内,没有观察到明显的基础能力退化。

但这不等于”证明无损”。hankin自己强调:没做完整的同协议A/B(BF16 vs W4A16 vs关闭投机)。未测过的任务区间(长链条代码重构、小语言、多模态)无法保证。

fbe8f5fdd94aec46af9f4e3336f0b209bd6e360871803307cffbc6e804b6c843 article

第三部分:体验和隐藏的坑

配置门槛速查表

27B模型4-bit量化后约15-17GB。不同显存的体验差异很大:

显存规格 体验评价 备注
24GB(RTX 3090/4090/5090) 富余 模型+KV cache 22.3GB,可跑64K上下文,单流120+tok/s
16GB(RTX 5080/5070Ti) 能跑 上下文受限,日常对话/代码编辑没问题
12GB(RTX 4070 Ti) 勉强 Q3量化约14.4GB,体验打折明显
Mac M5 Max 可观 实测40+tok/s

这周有个热搜词:”4090能部署什么大模型””小显存部署大模型”。问这种问题的已经不是极客,是被DeepSeek涨价困扰的开发者。

真实能干什么

跑分之外,社区用户的实际使用场景更说明问题。

Reddit本月有个高赞帖(799赞):单张3090,普通量化版。给模型一个凭证和大学名,它自己穿过层层校园网站拉出课表——零人工干预,执行了80次工具调用。还有人让它自己下载视频、抽帧”看”内容、装Whisper跑转录。

X上也出现很多新帖子:”stopped paying for AI coding today”——今天起,停掉AI编程订阅。这些不是概念验证,是已经在跑的实际工作流。

三条清晰的边界

1.并发上限是硬的

服务最大序列数8:

  • 1路聚合:94.8 tok/s

  • 8路:180.4 tok/s

  • 16路:还是180.4 tok/s(但首token等待从5.0秒涨到11.4秒)

建议:把活跃推理并发控制在8以内,等待队列放在服务外部。

2.长上下文首token成本不能忽略

Prefill速度约1,000 tok/s,TTFT随输入长度线性上涨:

  • 128 token输入:0.61秒

  • 32K输入:29秒

  • 60K输入:59秒

  • 64K返回HTTP 400(服务不崩)

结论:64K不是”不能跑”,而是要接受长文档场景接近一分钟的首响应时间。提示词压缩、分块检索、前缀缓存,仍然比盲目塞满64K重要。

3.Prefix caching的收益被严重低估

同一份25K文档的第二次提问,首token时间从22.4秒降到0.56秒,答案逐token不变。对”加载一次文档、反复提问”的场景(RAG、代码助手),这个收益比吞吐数字更直接决定体验。

真正的坑:思考档位”不肯收尾”

这是这次独立验收里最有价值的发现。

Qwen3.8默认开启思考模式,且reasoning_effort默认是xhigh。hankin观察到:模型持续推理,但迟迟不给最终答案。

在12K输出预算下:

  • GPQA-Diamond:总准确率55%,43%的题打满预算没有最终答案

  • AIME 2026:总准确率43.3%,57%的题没有在预算内结束

把预算放宽到24K,两项分别回升到72%和60%——但仍有24%和37%的题不收敛。

关键在于定性:这些”未完成”大多不是重复死循环,模型仍在换元、验证、分类讨论——推理过程是健康的,只是不肯进入收尾阶段。对已经收敛的题,GPQA-D和AIME的条件准确率分别是93.4%和94.7%。模型会做,但它不交卷。

调低思考档位呢?hankin做了15题的探索性配对(5道GSM8K、5道GPQA、5道AIME,每题分别跑xhigh和medium):

档位 准确率 输出token中位数
xhigh 11/15(73.3%) 3,599
medium 14/15(93.3%) 1,457

Medium的成本不到xhigh一半,准确率反而更高。

这个样本很小(hankin自己强调:15题、每题每档只采样一次),结论不该推广。但指向很实用:在你的真实负载上,默认xhigh未必是更好的默认值;medium作为试运行起点,性价比大概率更高。

第四部分:对开发者的建议

三类适合入场

1.重度用户

每天都在跑编程agent、批量文档、自动化流水线,API月账单已经上千。一块二手24GB卡几个月回本。本地部署对他们不是”省钱”,是”把成本从不可控变成可控”。

2.隐私刚需

公司数据不能出门、内部代码不能上云。开源27B是唯一够得着的”旗舰平替”——参数规模足够大,效果足够好,部署门槛足够低。

3.喜欢折腾的

这一周社区有人提交240K上下文优化、有人自己做KV cache代理、有人移植到AMD和华为NPU——玩的就是过程。对他们,部署本身就是价值。

两类人建议冷静

1.轻度用户

偶尔写文案、问问题——涨价后一年多花的钱,可能不够一张3090的一半。Token自由的投入产出比,对轻度用户算不过来。

2.想”一劳永逸”的

硬件会过时、模型月月换代。买卡买的是当下,不是永久。V2EX四月就有人提醒:”两个月后出了40-60B新模型,你的硬件就跑不动了。”

拼卡陷阱:预算砍太狠会很难受

低预算方案的体验可能差一个量级。有用户为省钱用双RTX 5060 Ti 16G凑显存跑27B:

  • 实测只有23 tok/s

  • 原因:位宽太小+双卡通讯损耗

显存够不等于体验好——位宽、通讯带宽、单卡vs双卡,都会让同一个模型在不同硬件上差出一个量级的体验。

成本结构分析

这不是”零成本”的生意。

据业内人士:微调验证用本地卡;真正的线上推理,买卡的经济性普遍不划算。DGX Spark两台一年亏3万;单卡5090跑满24小时一年赚3万(批发模式,不等于自用)。

但混合策略可能有戏:

  • 日常轻量用API

  • 重活、私事、自动化放本地

  • Token自由的本质不是零成本,而是多一个选项

投入前的检查清单

如果想在自己的消费级显卡上试,这是务实的投入策略:

  1. 思考请求默认reasoning_effort=medium,最难的任务允许一次受控重试

  2. 活跃并发不超过8,队列留在应用层

  3. 长文档优先检索和压缩,别把64K当免费容量

  4. 区分负载类型:贪心写作、采样思考、长上下文,不要用一个吞吐数字代表所有场景

  5. 把当前部署视为”功能候选”,而不是通过长期稳定性验收的生产版本

最后一句话

速度的军备竞赛已经打到381 tok/s,消费级显卡部署大模型已经从”能不能”进入”好不好”的中段。这套方案对普通用户仍非开箱即用——模型下载、再量化、打补丁、Docker或venv,一条都不少。

但对愿意折腾的人,一张二手老旗舰加上一个Apache-2.0的仓库,此刻能换来的本地推理体验,在一年前是不可想象的。

务实的姿势是:日常轻量用API,重活、私事、自动化放本地。

Token自由的本质不是零成本,而是多一个选项。

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]