博主头像

Qwen3.8-Flash-Next 突然开源!125B 模型本地运行,显存不够硬盘来凑,居然真能跑

外来客 • 2026-09-05 18:28:05

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

🚀 核心观点

  • Qwen3.8-Flash-Next 开源发布,125B 参数模型支持本地部署,低显存设备可通过硬盘补足内存实现运行。
  • 该模型在代码生成、Agent 性能及多模态任务上表现强劲,盲测效果优于部分顶级闭源模型。

📊 关键事实与论据

  • 架构特性:采用 MoE 混合专家架构,每 Token 激活约 60B 参数;原生支持 26.2 万上下文,扩展后可达百万 Token。
  • 部署实测:使用 GGUF 格式量化版(如 UD IQ4 HS),配合 llama.cpp 及 MMAP 技术,在 24GB 显存、64GB 内存及 2TB 硬盘环境下成功运行,速度约 10-11 Token/秒。
  • 性能对比
  • 与 Qwen3.5 Flash 对比:生成蜂鸟游戏效果更佳。
  • 与 Opus 5、GPT-5.6S 盲测:在代码推理及 Agent 任务中达到意想不到的优异效果,视觉光照与相机指令遵循更精准。
  • 与 Qwen3.8 27B 对比:Flash Next 侧重体验与视觉效果(如大气光晕),27B 侧重计算物理等技术的精准度。
  • 长程任务:MacBook Pro (M5, 64GB) 上运行速度约 30 Token/秒,完成包含网络搜索、Python 调用及表格整理的 8 分钟 Agent 循环;另一案例中自主调试游戏长达 5 小时,消耗 7000 万缓冲 Token。

💡 结论

  • Qwen3.8-Flash-Next 证明了大参数 MoE 模型在本地硬件上的可行性,通过硬盘映射解决了显存瓶颈。
  • 该模型在保持高推理效率的同时,显著提升了代码生成质量与多模态视觉体验,适合追求高性能本地部署的用户。

博主头像 👤 同一博主

查看该博主全部 100 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。