博主头像

GLM-5.3发布,主攻编程和智能体能力 | 智谱AI | Coding Agent | 网络安全

外来客 • 2026-08-16 16:49:39

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

🚀 核心观点

  • GLM-5.3 聚焦编程与智能体能力,通过大规模后训练实现性能跃升,而非改变基座架构。
  • 模型在网络安全领域表现超预期,安全能力被视为约束更严格的编程能力延伸。
  • 智谱主张“开源的盾”,认为开放权重能提升行业整体安全水位,对抗恶意攻击。

📊 关键事实与论据

  • 参数与训练:拥有 7430 亿参数,基座与 GLM-5.2 相同,提升源于几十倍规模的长程任务环境和超长后训练时间。
  • 编程基准:TerminalBench 2.1 得分 88.2,超过 DeepSeek V4 Pro 和 Claude Opus 4.8;DeepSway 测试比上一代高 20 多分。
  • 智能体基准:Automation Bench 和 Agent's Last Exam 中,GLM-5.3 取得最高分或平手,超过 Kimi K3、Fibo 5 和 GPT-5.6 SO。
  • 安全测试:CyberGym 代码审查得分 84.5%;ExploitBench 得分 54.4%(GLM-5.2 为 24.4%);ExploitGym 两小时完成 105 项漏洞利用任务。
  • 实际案例
  • 协助 Hugging Face 分析 17000 条攻击操作,重建攻击时间线。
  • 发现 Cursor 二进制代码中的潜在风险,以及某国民级通讯软件(疑似微信)的远程控制漏洞。
  • 在 DNS 协议中发现潜伏 40 余年的漏洞,可放大 8 万倍计算压力,影响超 1000 万个公网服务。
  • 协助 DeepSpec 发现机器人厂商系统中的致命漏洞,可远程劫持上千台机器人。

🛡️ 结论与影响

  • GLM-5.3 已迈入编程与智能体能力的第一梯队,但在最复杂软件工程任务上仍略逊于部分旗舰模型。
  • 安全审计正从流程末端前移,融入代码编写、测试与验证的闭环中。
  • 智谱启动“开源的盾”计划,包括免费安全审计、提供模型额度及在 Zcode 中集成代码审计功能。
  • 尽管开放权重可能降低恶意使用门槛,但智谱认为封闭模型反而加剧安全风险,开源是更安全的策略。

博主头像 同一博主

查看该博主全部 36 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。