DeepSeek竟然也遭遇斩杀线 | Qwen3.8-Flash Next | GLM-5.3-Fl
外来客 • 2026-08-28 10:32:50
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
📉 市场动态与价格战背景
- DeepSeek V4 Flash 于 8 月 17 日实施峰谷分时计费,闲时输入价格上涨约 57%,输出价格上涨约 136%,高峰时段输出价格接近旧价格的 4.7 倍。
- 涨价导致 DeepSeek 在 OpenCode 平台的日 Token 量从 18 万亿峰值跌至一半以下,空出的近 10 万亿日需求被匿名模型“OxAlpha”承接。
- 8 月 26 日晚,智谱揭晓 OxAlpha 身份为 GLM-5.3 Flash,阿里同日发布 Qwen3.8 Flash,两家几乎同时推出带“Flash”后缀的低成本模型。
- 匿名测试期间,OxAlpha 在 6 天内累计处理 44 万亿 Token,OpenRouter 过去 7 天调用量达 23.2%(2 万亿 Token),位列第一,且全部由国产芯片集群承载。
🏗️ Qwen3.8 Flash 架构与性能
- 该模型为多模态 MoE 架构,总参数 125B,每 Token 激活 6B,支持 26 万至 100 万 Token 上下文。
- 引入自研 QSA(吸收注意力)算法,通过块级重要性估计降低索引成本,在 100 万 Token 设定下预填充和解码阶段分别实现最高 7.6 倍和 4.9 倍加速。
- 采用门控残差连接,将单一残差流扩展为四条并行分支,动态决定信息读写路径,提升深层信号传递效率。
- 引入 N-gram 嵌入,增加 51B 参数但不增加每 Token 计算量,参数可存放于主机内存,通过预取与计算重叠降低显存占用。
- 训练使用 MioA 优化器,训练开销仅为前代 Qwen3.7 Plus 的约 1/9,激活参数为其 1/3,但在 Deep3 1.1 等基准上得分更高(58.7 分 vs 16.5 分)。
- 定价为每百万 Token 输入 0.8 元,输出 2.7 元,约为 Qwen3.8 Max 的 1/10,低于 DeepSeek 调价后价格。
🚀 GLM-5.3 Flash 架构与性能
- 总参数 320B,激活 18B,层数从 92 层减至 45 层,是 GLM-5 系列首个原生多模态模型。
- 采用吸收注意力与线性注意力混合架构,引入 Index Pool 压缩索引器缓存,注意力计算量降低 3.01 倍,KV 缓存大小降低 4.44 倍。
- 在 Artificial Analysis 综合智能指数中得分 57 分,与 Claude Opus 4.8 持平;编程表现与 Opus 4.8 相当。
- 定价为 GLM-5.3 的 1%,Opus 4.8 的 1%,强调“同样的智力,1% 的价格”。
- 原生多模态重点在于视觉编码,支持前端开发、游戏开发等场景,能自主判断何时观察并利用视觉反馈指导行动。
- 案例显示该模型在 Blender 中自主运行 16 小时,搭建约 400 平方米的专业主厨自宅和测试厨房。
💻 国产芯片与推理效率
- 智谱首次在大规模流量中使用国产芯片集群提供服务,通过自研高带宽互联网络连接。
- 在 SGLang 基础上构建专用推理引擎,采用激进的内存优化、节点内张量并行和混合缓存量化技术。
- 推理引擎构建由 GLM-5.3 驱动的 InfraAgent 加速,协助开发算子、诊断瓶颈,端到端服务性能提升 3 倍。
- 硬件效率和单 Token 成本达到与主流 NVIDIA GPU 相当的水平。
- 2026 年超大规模云厂商推理资本开支首次超过训练开支,核心矛盾转为内存带宽与通信延迟。
💰 成本竞争与行业趋势
- DeepSeek 在缓存命中价格上仍具优势,闲时约 0.007 美元/百万 Token,高峰约 0.014 美元。
- GLM-5.3 Flash 五折后缓存输入价格约 0.015 美元,Qwen 与 GLM 在新输入输出占比高时更具价格优势。
- 2025 年 1 月 DeepSeek R1 发布曾导致 NVIDIA 单日暴跌 17%,但 2026 年 4 月 V4 发布后 NVIDIA 收涨 4.3%,表明更便宜的模型可能激发更多推理需求。
- 竞争核心从提升智能水平转变为用最低成本交付足够强的智能,架构优化成为压低成本的关键。
👤 同一博主
DeepSeek公开DSec平台技术细节 | Agent训练 | 沙盒平台 | 梁文锋 | AI基础
就业不会被AI摧毁 | 白宫顾问David Friedberg | 美国经济 | 社会主义 | A
Claude发现类CRISPR新型酶系统 | Claude | Anthropic | CRISP
AI将会带来一场文艺复兴 | Demis Hassabis | DeepMind | AlphaFo
万亿美元AI资本开支的回报在哪里 | 黑石Jon Gray | 数据中心 | AI算力 | 工业革命
【分享】Elon Musk央视采访完整版
JEV CEO:RLHF是走弯路 | RLHF | OpenAI | 大语言模型 | 人工智能 |
中国具身智能泡沫 | 人形机器人 | 数采中心 | 邵天兰 | 宇树科技 | 银河通用 | 梅卡曼德
GPT-6与Claude Opus 5.5同日发布 | 模型价格战升级 | GPT-6 Luna
AI 2040计划:为超级智能争取时间 | 超级智能 | AI安全 | AI对齐 | AI控制 |
🧭 类似博主
-
什么是Medicare?| Money Unscripted | Fidelity Investme
-
被忽视的物流地产龙头Prologis(PLD)即将抢占AI热潮红利
-
前迪士尼CEO鲍勃·查佩克(Bob Chapek):公司亟需“增长引擎
-
Anthropic IPO招股书:营收46亿美元、亏损420亿美元及人类生存风险警示
-
Agree Realty(ADC):下一个Realty Income?股票分析
-
近五分之一美国家庭为百万富翁,但关键在于定义
-
体育如何预示“万物泡沫
-
十月已至:股市通常会发生什么?
-
积累财富需要做出不受欢迎决策的勇气 | 2026年9月29日
-
Realty Income(房地产收入公司)股票值得关注:内在价值测算显示10%回报率
0 条评论
发表评论
请先 登录 后参与讨论。