DeepSeek史上最长宕机!新模型V4来了?
外来客 • 2026-08-23 18:13:27
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
📉 宕机事件与算力瓶颈
- DeepSeek 昨晚 9 点半发生严重宕机,持续约 7 至 8 小时,被外媒称为其上线以来最严重的一次故障。
- 过去一年内,DeepSeek 日活用户数增长 67%,但算力规模仅增长 8% 左右,基础设施出现明显滞后。
- 尽管面临服务器繁忙问题,团队未优先通过限制用户用量、融资购买服务器或推广会员制来解决,而是将资源投入底层研究。
- 宕机频率在 3 月呈加快趋势,包括 3 月 5 日约 40 分钟、3 月 10 日一个多小时、3 月 18 日 9 分钟及昨晚的长时间中断。
🧩 核心技术拼图解析
- MHC(流形约束超连接):基于字节跳动提出的 HC 概念改进,通过引入多面体数学空间约束信号传输规则,解决大模型训练中因多层信号干扰导致的稳定性崩溃问题。
- 该技术使 3B、9B 及 27B 规模模型的训练保持稳定性,梁文峰作为共同作者署名,显示其对训练万亿参数大模型稳定性的高度重视。
- NSA(原生稀疏注意力):获得 ACL 2025 最佳论文,通过压缩、选择及局部上下文三组并行处理机制,大幅降低长文本注意力计算的平方级复杂度。
- NSA 并非后处理优化,而是从训练阶段融入,在 64K 序列长度上解码速度为标准注意力的 9 倍,且序列越长加速效果越显著。
🚀 V3.2 验证与 V4 预期
- V3.2 版本已小规模验证,引入 DSA 技术将上下文窗口从 128K 扩展至 100 万 Token,API 价格下降 50% 以上。
- V3.2 Special 变体在多项基准测试中超过 GPT-5,证明在保持 671B 参数规模下,仅通过优化注意力机制和训练策略即可显著提升性能。
- 预计 V4 总参数量提升至至少 5 万亿水平,同时控制激活参数以降低推理成本,上下文长度至少达到 100 万 Token。
- V4 可能整合文本、图像及视频的多模态能力,并有望采用华为昇腾等国产芯片,以减少对美国芯片的依赖。
💰 市场影响与 Agent 生态
- Polymarket 数据显示,V4 在 3 月前发布的赔率从 87% 跌至 9% 以内,目前约 54% 的人认为其将在 4 月 15 日前发布。
- 随着 Agent 应用普及,单次任务 Token 需求量暴增至数万甚至数十万级别,导致国产模型因算力吃紧而面临涨价压力。
- 市场期待 V4 在提升模型能力的同时,能将 Token 价格进一步降低 90% 至 99%,使 Agent 技术进入大众可负担范围。
- 用户期待 DeepSeek 延续去年冲击英伟达市值的表现,通过技术突破和成本优化为行业提供新的竞争格局。
👤 同一博主
GPT-6 Astra做3D绝了!我两天建了一座能开车的巴黎(赠300页手把手教程)
我雇了三个AI员工开发我的产品,今天正式开源!【免费使用DeepSeek V4 flash】
Claude Fable 5 发布!我用它 5 小时做了个 macOS App,已开源
我逆向了Claude Design!一句话帮你生成任何出色设计,开源后狂揽GitHub 1.6万+s
首发实测腾讯最新龙虾🦞产品:Marvis
DeepSeek V4是怎么训练出来的?73页PPT深入解析
GPT-5.5首发实测!比Claude Opus4.7强?
【首发】Claude Opus 4.7解读!细思极恐的技术报告
我蒸馏了17个大佬给我打工(开源免费)
谷歌最新模型Gemma4发布!深度解析+送42页资料
🧭 类似博主
-
聊聊最有争议的一场苹果发布会!
-
如何使用ChatGPT Images 2.5(分步教程)
-
境外最强接码手机号|eSIM.GG 乌龟卡|🇪🇪爱沙尼亚手机号 | Telegram接码|Whats
-
从游戏商业帝国到国产单机游戏史,「GPASS回归游戏季」都会聊些什么?
-
AI晶片背後的巨人!EUV、光罩、先進封裝全掌握!獨家專訪蔡司高層!
-
【看片自由】2款免费AI同声传译:YouTube字幕实时翻译+本地离线部署!
-
别再在Excel表格间复制粘贴数据了!试试这个方法
-
和五月天阿信见了他
-
4 大极限实测:用代码写 3D 动画,MiniMax H3 渲染写实大片
-
iPhone Duo确实支持MagSafe,但存在局限
0 条评论
发表评论
请先 登录 后参与讨论。