博主头像

DeepSeek史上最长宕机!新模型V4来了?

外来客 • 2026-08-23 18:13:27

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

📉 宕机事件与算力瓶颈

  • DeepSeek 昨晚 9 点半发生严重宕机,持续约 7 至 8 小时,被外媒称为其上线以来最严重的一次故障。
  • 过去一年内,DeepSeek 日活用户数增长 67%,但算力规模仅增长 8% 左右,基础设施出现明显滞后。
  • 尽管面临服务器繁忙问题,团队未优先通过限制用户用量、融资购买服务器或推广会员制来解决,而是将资源投入底层研究。
  • 宕机频率在 3 月呈加快趋势,包括 3 月 5 日约 40 分钟、3 月 10 日一个多小时、3 月 18 日 9 分钟及昨晚的长时间中断。

🧩 核心技术拼图解析

  • MHC(流形约束超连接):基于字节跳动提出的 HC 概念改进,通过引入多面体数学空间约束信号传输规则,解决大模型训练中因多层信号干扰导致的稳定性崩溃问题。
  • 该技术使 3B、9B 及 27B 规模模型的训练保持稳定性,梁文峰作为共同作者署名,显示其对训练万亿参数大模型稳定性的高度重视。
  • NSA(原生稀疏注意力):获得 ACL 2025 最佳论文,通过压缩、选择及局部上下文三组并行处理机制,大幅降低长文本注意力计算的平方级复杂度。
  • NSA 并非后处理优化,而是从训练阶段融入,在 64K 序列长度上解码速度为标准注意力的 9 倍,且序列越长加速效果越显著。

🚀 V3.2 验证与 V4 预期

  • V3.2 版本已小规模验证,引入 DSA 技术将上下文窗口从 128K 扩展至 100 万 Token,API 价格下降 50% 以上。
  • V3.2 Special 变体在多项基准测试中超过 GPT-5,证明在保持 671B 参数规模下,仅通过优化注意力机制和训练策略即可显著提升性能。
  • 预计 V4 总参数量提升至至少 5 万亿水平,同时控制激活参数以降低推理成本,上下文长度至少达到 100 万 Token。
  • V4 可能整合文本、图像及视频的多模态能力,并有望采用华为昇腾等国产芯片,以减少对美国芯片的依赖。

💰 市场影响与 Agent 生态

  • Polymarket 数据显示,V4 在 3 月前发布的赔率从 87% 跌至 9% 以内,目前约 54% 的人认为其将在 4 月 15 日前发布。
  • 随着 Agent 应用普及,单次任务 Token 需求量暴增至数万甚至数十万级别,导致国产模型因算力吃紧而面临涨价压力。
  • 市场期待 V4 在提升模型能力的同时,能将 Token 价格进一步降低 90% 至 99%,使 Agent 技术进入大众可负担范围。
  • 用户期待 DeepSeek 延续去年冲击英伟达市值的表现,通过技术突破和成本优化为行业提供新的竞争格局。

0 条评论

发表评论

请先 登录 后参与讨论。