博主头像

Claude Code源码泄漏,首发解读51万行代码!

外来客 • 2026-08-21 14:22:55

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

📂 事件背景与数据

  • Anthropic 的 Claude Code 在 4 月 1 日前一天的更新中,因构建流水线失误,将 60MB 的调试文件包含在 NPM 发布包中,导致 1900 多个文件、51 万行 TypeScript 源码泄露。
  • 该错误并非首次发生,去年产品发布初期曾出现类似情况。
  • 泄露代码被迅速上传至 GitHub 仓库,短时间内获得 21 万 Star 及接近 30 万 Fork。
  • 此次泄露被视为学习顶级 AI 编程工具工程架构的罕见机会。

🏗️ 核心架构与工程理念

  • 结论认为 Claude Code 60% 的性能依赖模型本身能力(如 Opus 4.6),40% 依赖围绕模型搭建的工程系统。
  • 引入“Harness Engineering”(驾驭工程)概念,将 AI 模型比作野马,通过工具、安全机制、记忆系统、上下文管理等“缰绳”使其输出稳定可靠。
  • 系统提示词采用拼接结构,包含静态共享规则(如禁止编造数据、优先使用专用工具)和动态个性化参数。
  • 采用“Dynamic Boundaries”设计,静态部分全球用户共享缓存以降低成本,动态部分独立加载以保证个性化。
  • 工具调用存在隐性成本,每个 MCP 工具定义消耗 4000-6000 tokens,5 个工具可能占用上下文 12%,因此工具并非越多越好。

🛡️ 安全机制与权限管理

  • 引入“YOLO Classifier”机制,在主 AI 执行操作时,由独立的 AI 分类器进行安全审查。
  • 分类器拥有独立系统提示词,判断结果分为三类:Allow(直接放行)、Soft Deny(降级为需确认)、Hard Deny(直接拦截)。
  • 这种多层级门禁设计(类似大楼安保)有效防止了误删文件等事故,建立了用户信任基础,使得用户敢于开启高权限模式。

🧠 记忆系统与上下文管理

  • 记忆系统区分核心记忆与文件索引,分为全局记忆和项目记忆。
  • 记忆提取并非每条消息触发,而是在 AI 完成完整回答且无后续工具调用时启用,并设有每 N 轮检查一次的限流机制。
  • 提取工作由权限受限的“Folk Agent”执行,仅能读取文件和写入记忆目录,禁止执行 Bash 命令。
  • 记忆内容分为用户偏好、行为反馈、项目信息、外部资源引用四类,明确不记录代码事实,以避免代码重构后记忆失效导致的误导。
  • 设有“AutoDream”机制,当项目整理超过 24 小时且积累 5 个以上新会话时,后台自动整理记忆文件。
  • 上下文压缩采用结构化九段式提取,保留核心请求、关键概念、文件代码、错误恢复、用户消息、待办任务、当前工作及下一步指南。

🔍 技术实现与彩蛋

  • 代码搜索未使用向量数据库、Embedding 或 RAG,而是采用最朴素的文本搜索(Grep),依赖模型自主能力完成信息检索。
  • 源码中包含未发布的虚拟宠物系统,拥有 18 种物种(如鸭子、猫、龙等)及稀有度系统,代码注释幽默地提到使用随机数生成器“挑鸭子”。
  • 存在多个 Future Flags,暗示产品未来将向更主动思考和持续运行的 AI 伙伴方向演进。

🌍 行业影响与展望

  • Claude Code 近期 52 天内发布 74 次,迭代速度极快,形成强者恒强的飞轮效应。
  • 源码泄露使开源社区和国内大厂有机会站在同一起跑线,借鉴其架构经验。
  • 结合 Kimi、DeepSeek 等国产模型能力的提升,预计未来可能出现高度还原 Claude Code 体验的国产替代品。
  • 竞争焦点将从单纯模型能力转向“Harness Engineering”的工程化能力,即谁更好地搭建驾驭 AI 的系统。
  • 此次泄露被戏称为 Claude Code 的“越狱”或“永生”,使其不再依赖单一服务器,代码散布于互联网角落。

0 条评论

发表评论

请先 登录 后参与讨论。