博主头像

👤 同一博主

按发布时间查看该博主的全部资讯要点

查看全部博主 →
博主头像

🎬 Agent搜索和记忆的基础设施:腾讯云 Elastichsearch Service 企业版详细攻略

🎯 核心观点 随着模型能力趋同,Agent 领域的竞争焦点转向搜索与记忆基础设施。 企业级场景下,本地知识库方案难以满足高并发、大规模数据需求,Elasticsearch 是成熟的技术选择。 腾讯云 ES 企业版通过自研优化,解决了大规模集群长期稳定运行及成本高昂的痛点,实现了 Agentic Search 的深度适配。 📊 关键事实与论据 性能与成本优化:相比传统向量数据库方案(需 400 台 64GB 机器),腾讯云 ES 方案仅需 30 台机器,大幅降低硬件成本。 技术指标提升:在 AS 搜索部分场景下,性能最高提升 5 倍,混合搜索延迟下降 60%,内存资源占用减少 50% 以上。 技术架构创新:引入冷热分离的 Slice Disk BBQ 架构、文本向量融合索引的 Filtered Disk BBQ 架构,以及查询并行化、存算分离等自研优化。 社区贡献:腾讯云是 Elasticsearch 开源社区贡献最多的第三方公司,累计提交 260 多个 PR。 功能集成:深度集成 Inference API,可直接对接云上大模型、向量和重排服务;支持跨集群查询及统一平台管理。 🛠️ 结论与适用建议 适用场景:适用于数据规模达亿级、十亿级,且要求高并发、高可用及长期稳定运行的企业级 Agent 检索系统。 核心优势: 检索增强:通过 Disk BBQ 降低向量检索内存依赖,支持 GPU 加速索引构建,利用 RRF 融合关键词与语义搜索结果。 Agent 友好:在 Kibana 中直接创建智能体,验证 RAG 效果,通过 MCP 等接口将 ES 数据接入其他 AI 业务系统。 成本降低:利用 COS 对象存储存放冷数据,结合日志压缩技术降低长期存储成本。 平台统一:整合搜索、日志分析、可观测性和安全能力,支持一键从 8 版本升级至 9 版本解锁企业版功能。 实施建议:对于个人轻量级需求,现有方案已足够;但面对企业级复杂场景,建议采用腾讯云 ES 企业版以简化基础设施维护,快速搭建高可用检索系统。

博主头像

🎬 Pi 大道至简,超越Codex和Claude Code的极简Agent,保姆级全攻略, 一期视频精通

🚀 核心定位与性能优势 极简架构:Pi 仅包含 4 个基础工具(读、写、改文件及运行命令),系统提示词仅约 1000 token。 资源效率:在 Pi 中发送“你好”仅消耗 1100 输入 token 和 4000 分上下文;相比之下,Codex 仅打招呼即占用 18000 token,白白消耗 7% 上下文窗口。 基准测试表现: 速度:Composial 测试显示,Pi 完成编程任务速度比其他 Coding Agent 快 1.5 到 2 倍。 成本与质量:Databricks 在百万行代码仓库测试中,Pi 在同等成本下任务成功率高于 Claude Code 和 Codex。 最佳组合:代码质量最高点为 Pi 搭配 Claude Opus 4.8 模型。 💻 安装配置与模型接入 安装流程: Windows:通过 PowerShell 执行官网一键命令,自动检测并安装 Node.js 和 Git Bash。 MacOS:在终端执行 CURL 命令即可安装。 模型配置: API Key 模式:支持 40 多家供应商,如 DeepSeek。需创建 API Key 并填入 Pi。 订阅模式:支持 OpenAI Codex 等订阅服务,通过浏览器登录授权,无需额外 API Key。 模型切换:使用 `/model` 命令切换模型(如 DeepSeek V4 Pro/Flash),`Shift+Tab` 调整思考强度,`Ctrl+L` 快速打开模型选择器。 ⚡ 核心交互与指令控制 多行输入:`Shift+Enter` 换行,或 `Ctrl+G` 打开记事本编辑长提示词。 指令追加机制: Steering(引导):默认模式。在执行中途插入指令,AI 立即改变执行方向(如中途要求改用 Next.js)。 Follow Up(排队):Windows 需删除 PowerShell 全屏快捷键 `Alt+Enter` 冲突,使用 `Alt+Enter` 发送;Mac 使用 `Option+Enter`。指令排队等待当前任务完成后执行。 非交互模式:使用 `-p` 参数后接指令,后台静默执行一次性任务(如查天气写文件)。 命令执行:单 `#` 运行命令且 AI 可见结果;双 `##` 运行命令且 AI 不可见。 🌳 会话管理与对话树 Session 管理: `/new`:开启新会话,清空上下文。 `pi -c`:从最近一次 Session 继续。 `pi -r`:挑选特定 Session 恢复。 `/clone`:完整复制当前 Session。 `/fork`:基于某个节点创建新 Session,仅携带之前的历史。 对话树(Tree): `/tree`:进入树状结构,可回退到历史节点并创建分支。 回退限制:树仅回退对话历史,不回退代码。代码回退需配合 Git(如 `git reset --hard`)。 总结选项:回退时可选择“不总结”、“自动总结”或“自定义总结”,总结仅针对当前分支,不影响其他分支。 上下文压缩:`/compact` 手动触发压缩,降低 Token 消耗;建议任务结束后直接 `/new` 以清空上下文,优于压缩。 🧩 插件系统与能力扩展 插件安装: 全局安装:默认安装到全局目录,对所有项目生效。 项目级安装:命令后加 `-l` (local),仅对当前项目生效,减少无关项目的提示词负担。 核心插件功能: Pi Web Assist:零配置联网搜索,接入 XR MCP 服务,无需 API Key。 Pi Subagents:并行运行多个子代理(如同时开发 5 个不同风格网页)。 Pi MCP Adapter:通过 `.mcp.json` 配置 MCP Server(如高德地图)。 BTW (By The Way):旁路对话,在不打断主任务的情况下提问。 Plan Mode:先生成计划文件供修改,确认后再执行。 Go Mode:设定长期目标,多轮次迭代直至完成(如开发坦克大战游戏)。 Dynamic Workflows:动态调度数十个子代理协同工作,类似 Claude Code 特性。 WeChat Assistant:连接微信,实现手机端指令交互。 🛠️ Skills 技能与外部 UI Skills 协议: 项目级:放置于项目目录 `.agents/skills` 文件夹。 全局级:放置于用户 Home 目录 `.agents/skills` 文件夹。 示例:Playwright CLI(浏览器自动化)、Markdown Converter(文档转换)。 外部 Web UI: 社区项目提供网页版界面,支持切换项目、配置模型(如 Kimi)、管理 Skills 和插件。 支持在 UI 中直接截图粘贴、调整思考强度、查看 Token 消耗。 关闭浏览器后可通过命令重新启动 Web UI。 🧠 记忆机制与安全策略 跨 Session 记忆: 项目级:在项目根目录创建 `agents.md`,AI 每次对话自动读取,用于补充项目背景或用户偏好。 全局级:在 Pi 全局配置目录 `agents` 文件夹下创建 `agents.md`,对所有项目生效。 系统提示词追加:全局配置目录下 `AppendSystem.md`,优先级更高,用于强制安全规则(如禁止批量删除文件)。 安全机制: 信任机制:在包含插件/Skills 的陌生目录启动时询问是否信任。 无沙箱设计:Pi 默认拥有最高权限,无内置沙箱,旨在保持极简高效。 外部隔离方案:推荐在 WSL、Hyper-V、Docker 容器或 K8s 中运行,以隔离风险。 权限插件:可安装 Pi Permission System 插件,对敏感操作(如删除文件)进行弹窗审批。 📚 架构解析与 SDK 应用 源码架构: AI 包:统一模型调用接口。 Agent 包:实现核心双层循环机制(内层处理工具调用,外层处理 Follow Up)。 Coding Agent 包:定义 4 个基础工具、系统提示词及插件机制。 TUI 包:实现命令行界面。 SDK 集成: Pi AI SDK:`npm install` 后引用 `create model` 方法,可在任意项目中接入多种大模型。 Pi Coding Agent SDK:提供开箱即用的 Coding Agent 能力,支持创建 Session 并下发任务。 DIY 插件:Pi 内置插件开发知识,用户可通过自然语言指令让 AI 自行编写插件(如天气展示、文件保护、删除确认弹窗),并支持项目级或全局级部署。

博主头像

🎬 一个Skill 让 Agent 自动操作浏览器,告别重复枯燥任务

🤖 核心观点 EgoLite 是一款基于 Chromium 内核的全新浏览器,专为 Agent(智能体)与人类共用 Chrome 而设计。通过引入 Space 独立工作空间架构及配套的 Skill 机制,它有效解决了传统浏览器自动化工具中反复登录、内存占用高、Token 消耗大及执行速度慢等痛点,实现了高效、低成本的自动化操作。 📊 关键事实/论据 技术优势与性能提升:EgoLite 将用户数据(Cookie、插件等)离线保存在本地,彻底解决重复登录问题。Space 架构可将内存和进程开销降低几十倍;通过 Node.js Headless 代码一次性执行多个动作,减少模型交互次数,Token 消耗显著降低。 实测案例与效率对比: ChatGPT 画图任务:相比传统手动操作(2-3分钟),Agent 自动化完成从生成到重命名下载的全流程。使用 Skill 后,Token 开销较无 Skill 摸索阶段降低近 4 倍;开启 10 个 Space 并行画图,效率提升 10 倍。 电商评论采集:在 Workbody 中调用 EgoLite Skill,抓取前 100 条评论并保存为 CSV。进一步将流程固化为脚本后,可实现“零 Token、全自动”执行,无需 Agent 参与。 复杂行程规划与求职搜索:Workbody 结合 EgoLite 并行查询票务、天气及攻略生成苏州厦门行程;或结合百度地图与招聘网站,筛选出离家最近的 20 个 Java 开发岗位并输出 CSV。 💡 结论 EgoLite 配合 Skill 机制能显著提升 Agent 操作浏览器的效率与稳定性。无论是简单的重复任务还是复杂的跨平台信息整合,均能通过并行处理(Space)和脚本固化实现“又快又省”的效果。目前 EgoLite Mac 版本免费开放,支持 Cloud Code、Workbody 等多种 AA Agent 零配置接入,适合需要高频浏览器自动化操作的办公及开发场景。

博主头像

🎬 Windows跑AI Agent,WSL才是终极答案,别羡慕Mac了, WSL保姆级全攻略,海量实

🖥️ Windows 运行 AI Agent:WSL 终极实战指南 💡 核心观点与优势分析 在 Windows 平台上运行 AI Agent(如 Pi、Hermes、Claude Code 等)时,原生 PowerShell 环境往往不够友好,导致命令报错频繁、执行效率低且浪费 Token。相比之下,Windows Subsystem for Linux (WSL) 是更优的解决方案,它能通过一行命令在 Windows 上运行 Linux 子系统,结合两大操作系统的优势。 使用 WSL 运行 AI Agent 的三大核心好处: 稳定性与效率更高:大模型训练语料多为 Linux/macOS 风格命令行,WSL 环境出错概率低,执行更顺畅。 生产环境一致性:代码通常在 Linux 服务器部署,在 WSL 中编写和测试可减少环境差异,使部署流程更丝滑。 环境隔离与安全:WSL 提供虚拟机与宿主机的隔离,即使 Agent 误操作损坏环境,也不会影响 Windows 主系统,重置即可恢复。 🛠️ 安装、配置与基础使用 1. 前置准备与安装 CPU 虚拟化:需在 BIOS 中开启(Intel VMX 或 AMD SVM Mode),任务管理器性能页可确认状态。 安装命令:在终端输入 `wsl --install`。国内网络建议加 `--download` 参数加速。若提示重启,请重启后再次执行。 用户设置:默认安装 Ubuntu,需设置用户名(如 techchamp)和密码(输入时不显示字符)。 2. 多发行版与管理 查看可选列表:`wsl -l -o` 列出在线可安装的 Linux 发行版。 指定路径安装:`wsl --install --location `,例如安装 Kali Linux 到 D 盘。 多实例管理:同一发行版可创建多个隔离实例(如 `wsl --install Ubuntu --name Ubuntu2`)。 启动与切换默认: 启动默认虚拟机:`wsl` 指定启动:`wsl -d ` 设置默认实例:`wsl --set-default ` 关闭虚拟机:直接关闭窗口或输入 `exit`。 3. 开发环境搭建(以 Ubuntu 为例) Git & Python:Ubuntu 自带 Git 和 Python3。若需使用 `python` 命令,执行 `sudo apt update` 后安装链接包 `sudo apt install python-is-python3`。 Node.js:推荐使用 NVM(Node Version Manager)。从官网复制 Linux 安装命令,依次执行三条命令,最后安装指定版本(如 Node.js 24),验证 `node -v` 和 `npm -v`。 🤖 AI Agent 实战部署与交互 1. Pi Agent 安装:使用 Curl 命令在 WSL 中安装。 配置:进入主目录创建项目文件夹(如 `mkdir PiTest`),运行 `pi`,选择 API Key 模式登录。推荐模型包括 DeepSeek、MiniMax 或 Kimi Code。 实战测试:让 Agent 使用 Next.js 编写坦克大战游戏。WSL 具备 Localhost 端口自动转发 功能,Windows 浏览器访问 `localhost:3000` 即可直接游玩 WSL 内的服务。 2. IDE 集成与文件管理 VS Code 连接:在 WSL 终端输入 `code .`,可直接调用 Windows 上的 VS Code 打开当前目录,支持代码修改、调试及 Git 操作(初始化仓库、Commit、Push)。 文件互访: Windows 访问 Linux:资源管理器左下角点击“Linux”图标,或 WSL 中输入 `explorer.exe .`。 Linux 访问 Windows:Windows 磁盘挂载为 `/mnt/c` 和 `/mnt/d`。建议项目放在 Linux 原生目录以减少跨系统 IO 开销。 图片输入:可将 Windows 桌面图片拖入 WSL 窗口,Agent 可识别挂载路径下的图片内容。 3. 其他 Agent 工具配置 Hermes Agent:复制 Linux 安装命令,选择 DeepSeek 等模型并填入 API Key,完成即时通信渠道配对即可启动 `hermes`。 Claude Code:执行安装命令后运行 `claude`,通过浏览器扫码授权登录。 Codex (ChatGPT Desktop):推荐在 WSL 中运行 CLI 版本以获得最佳性能。若使用 Windows App,需在设置中将“智能体环境”和“终端”切换为 WSL,但需注意跨系统 IO 效率较低的问题。 🐳 Docker 与 GPU 加速进阶 1. Docker 容器化开发 安装:WSL2 默认启用 Systemd,体验接近原生 Linux。执行官方指南中的第 1 和第 4 步命令即可安装。 实战 Redis:使用 `sudo docker run -d -p 6379:6379 redis` 一键启动 Redis 实例。Windows 上的客户端可通过 `localhost:6379` 连接。关闭 WSL 窗口容器即停止,重启后可通过 `docker start ` 恢复。 2. GPU 直通与推理 原理:WSL2 基于 Hyper-V,支持显卡直通,可直接调用 Windows 宿主机显卡驱动,无需在 Linux 内单独安装驱动。 验证:输入 `nvidia-smi` 查看 GPU 型号(如 RTX 5070)、显存及 CUDA 版本。 VLLM 部署:作为高性能推理框架,优先支持 Linux。通过 UV 创建虚拟环境并安装 VLLM,启动模型服务后,可使用 Postman 测试推理速度(示例中 8 秒完成大量词元推理)。 🖥️ 图形界面与网络配置 1. 图形化应用支持 WSLG (单应用):安装 Linux 图形软件(如 GIMP),直接运行即可在 Windows 桌面显示窗口。 完整桌面环境: Kali Linux:安装 `kali-win-kex`,输入 `kex` 启动远程桌面连接。 Ubuntu:依次执行官方命令启用桌面服务,获取 IP 后通过 Windows “远程桌面连接”工具(端口 3389)接入完整 Ubuntu 桌面。 2. 网络模式与访问控制 默认 Net 模式:WSL 拥有独立虚拟 IP,Windows 可通过 Localhost 转发访问 WSL 服务;WSL 需通过宿主机局域网 IP(`ipconfig` 查询)访问 Windows 服务。 镜像网络模式 (Mirrored): 配置:在 `C:\Users\\.wslconfig` 中添加 `[wsl] networkingMode=mirrored`,重启 WSL。 优势:WSL 与 Windows 共享同一局域网 IP,简化网络结构,允许手机等局域网设备直接访问 WSL 服务(需配合防火墙放行命令)。 ⚙️ 高级配置、备份与技巧 1. 配置文件详解 `.wslconfig` (Windows):全局生效。位于 `C:\Users\\`,用于修改内存限制、内核参数及网络模式。 `/etc/wsl.conf` (Linux):单虚拟机生效。例如设置 `[automount] enabled=false` 可关闭自动挂载 Windows 磁盘,提升安全性(AI 无法读取宿主机文件)。 2. 备份与克隆 导出:`wsl --export `,生成 `.tar` 文件。 导入/还原:`wsl --import `。可用于迁移至其他电脑或克隆多个相同环境(如 Ubuntu2, Ubuntu3)。 3. 命令行互通技巧 在 Windows PowerShell 中可直接调用 Linux 命令进行混合操作。例如:`Get-ChildItem | wsl grep video`,前半部分为 Windows 命令获取文件列表,后半部分通过 WSL 管道使用 Linux `grep` 进行筛选。

博主头像

🎬 Claude Code平替Kimi Code教程:视频理解,数据插件,Goal,Swarm,ACP等

🤖 核心观点 Kimi Code 是一款由 Kimi 开源的 Coding Agent,以高频迭代速度进化,内置最新开源模型 Kimi K2.7 Code。相比上一代 K2.6,其在编程体验上有显著提升,支持自由切换供应商与模型。该工具具备视频理解、官方数据插件、Swarm 群组模式及 ACP 协议等进阶功能,旨在通过高缓存命中率和低成本优势,提升大型代码库处理效率及多模态任务表现。 📊 关键事实/论据 安装与配置:支持一键命令安装,可通过 `/login` 订阅 Kimi API 套餐,或通过 `/provider` 添加第三方模型订阅。 Bug 修复实战对比:在修复拥有 7000+ 文件、72 万行代码的开源项目 Bug 时,Kimi Code(接入 K2.7 Code)耗时 7.5 分钟,Token 消耗 260 万,缓存命中率高达 97%,成本显著低于 Claude Opus 4.8。Opus 4.8 在默认设置下未成功修复,调高思考强度后虽成功但用时更长且无缓存统计优势。 多模态与视频理解:内置 `readmedia file` 工具,可识别视频内容(如 2022 年卡塔尔世界杯进球场景、时间),并利用 FFmpeg 进行切片、配乐制作集锦。支持 `/btw` 命令临时生成子 Agent 查询技术问题而不干扰主上下文。 数据插件与 Skills:安装 Kimi DataSource 插件后,可通过自然语言查询股市、金价等历史走势并绘制图表。Skills(如 Playwright CLI)可将工作流封装为专业技能包,需将配置文件夹从 `.cloud` 改为 `.agents`。 高级模式应用: `/go` 模式:适合多轮迭代任务,如结合浏览器自动化 Skill 复现“坦克大战”游戏,经 5 轮迭代、14 分钟完成。 Swarm Mode(群组模式):将复杂任务拆分给子 Agent 并行处理,如同时下载 6 篇 AI 论文并制作杂志风专题页,最后汇总输出,大幅提升编码效率。 IDE 集成:原生支持 ACP 协议,可无缝接入 Zed 等编辑器,实现对话与代码查看同步进行。 💡 结论 Kimi Code 凭借高缓存命中率、低成本及丰富的内置工具(视频理解、数据查询、并行处理),在处理大型代码库和多模态复杂任务上表现优异。其 `/go` 和 Swarm 模式有效提升了迭代效率与并行处理能力,配合 ACP 协议实现 IDE 深度集成,是兼具性价比与功能多样性的编程辅助工具。

博主头像

🎬 长期免费使用Codex,Hermes等Agent工具,保姆级攻略

🎯 核心观点 提供国内长期免费使用 Codex 及 Hermes Agent 的稳定方案,非短期试用。 通过开源工具将 Agent 底层模型替换为 Agnes 提供的免费全模态 API。 实现零成本获得一线模型体验,覆盖日常任务、图像生成及视频生成能力。 解决非官网订阅导致的内置图像生成 Skill 不可用问题,通过自制 Skill 替代。 🛠️ 关键事实与步骤 工具准备:使用开源软件 Codex++ 进行模型替换;使用 Agnes 平台获取 API Key。 Codex 配置: 在 Codex++ 控制台添加供应商,名称填 Agnes,接入方式选纯 API。 填写 Agnes 端点 URL 及 API Key,上游协议选 Chat,模型列表从上游获取。 重启 Codex 后,选择 Agnes 2.0 Flash 模型即可生效。 Skill 开发: 利用 Playwright CLI 配置浏览器自动化,将 Skill 文件夹名从 .Cloud 改为 .Codex。 使用 Skill Creator 编写调用 Agnes Image 2.1 Flash 的生图 Skill。 在脚本中硬编码 API Key 并替换占位符,完成测试。 Hermes 配置: 在 WSL 环境中启动 Hermes,配置模型为 Custom Direct API。 填写 Agnes 端点、API Key,格式选 Chat,模型选 Agnes 2.0 Flash。 添加微信 IM 渠道,扫码配对后即可在手机上使用。 ⚠️ 注意事项与结论 适用场景:适合需要低成本运行 Agent 任务、批量生成图像或故事绘本的用户。 性能表现:Agnes 2.0 Flash 在 Agent 驱动、Skills 执行及编程能力上表现稳定,能精准判断步骤。 功能限制:非官网订阅无法使用 Codex 内置图像生成,需依赖自制 Skill 调用外部 API。 成本优势:完全免费,无 Token 消耗压力,可随意进行创意开发。 操作前提:需具备基本的终端操作能力,能配置 WSL 及 GitHub 开源工具。

博主头像

🎬 Git+Github核心概念大串讲,从零到一全攻略,详细实战教程

🛠️ Git 与 GitHub 核心概念解析 版本控制本质:Git 是开源免费的版本控制软件,用于管理文件历史版本。其基本单元是 Commit(提交),每次提交保存仓库状态快照,形成可回溯的历史链路。 仓库类型:分为本地仓库(Local Repository,位于个人电脑)和远端仓库(Remote Repository,位于服务器)。GitHub 是全球最大的代码托管与协作平台,提供公开与私有仓库服务。 核心术语: Init:初始化文件夹为 Git 仓库,生成 `.git` 子文件夹。 Ignore:通过 `.gitignore` 文件排除不需要管理的文件(如密钥、`node_modules`)。 Branch:分支是独立的开发线,通过指针实现,无需拷贝代码。不同分支修改互不影响,合并(Merge)后可将改动汇入主干。 Head:指向当前仓库所处的最新 Commit。 WorkTree:基于新分支创建独立文件夹,支持并行开发,互不干扰。 Staging Area:暂存区,Commit 前的检查点,用于筛选待提交文件。 💻 环境配置与 AI 辅助操作 安装准备:需安装 Git、VS Code,并配置 AI Agent(如 Codex 或 Claude Code)。 AI 绑定流程: 在 GitHub 创建新仓库(Repository)。 在本地文件夹初始化 Git 项目。 使用 AI 将本地仓库推送到 GitHub 远端,完成授权绑定。 AI 操作优势:无需死记硬背命令,通过自然语言描述意图(如“回退到某次提交”、“撤销某次改动”),AI 自动执行底层命令(如 `git reset`、`git revert`)。 🔄 版本回退与冲突处理 三种回退方式: Discard:放弃未提交的更改,适用于单人开发。 Reset:强制回退到历史状态,若已推送远端需强制推送,多人协作分支禁用。 Revert:生成反向提交抵消某次改动,安全且适用于多人协作分支。 合并冲突(Merge Conflict):当两个分支修改同一文件同一行时产生。AI 可辅助识别冲突并提供保留选项(保留一方、保留双方或自定义顺序)。 Cherry Pick:拣选特定提交合并到主干,忽略其他提交。 Stash:临时存储未完成的代码,便于切换分支处理紧急任务后恢复。 Rebase:变基操作,将当前分支提交重新应用到目标分支之上,保持历史线性干净,但需强制推送,仅限单人分支使用。 🌐 GitHub 协作与开源贡献 仓库结构: Code:源代码库,可查看文件历史与更新日期。 Releases:发布版本信息,包含下载链接与更新日志。 Issues:问题讨论区,用于报告 Bug 或提出功能建议。 Stars/Forks:Star 表示收藏/点赞,Fork 表示复刻项目到自己名下。 开源贡献流程(Fork 模式): Fork:将上游项目复刻到自己账号下。 Clone:将复刻项目克隆到本地。 Branch:创建新分支进行修改,避免直接改动主干。 Sync:在提交 PR 前,先将上游主干最新代码同步到本地分支并解决冲突。 Pull Request (PR):发起合并请求,展示代码差异。 Code Review:管理员审核代码,提出修改意见或同意合并。 协作者模式:若被添加为项目协作者,无需 Fork,可直接拉取分支、修改代码并推送,最后提交 PR 供管理员审核。 ⚡ 实用技巧与快捷键 GitHub 快捷键: `/`:快速打开搜索。 `T`:定位文件搜索栏。 `L`:定位行号。 `?`:查看快捷键速查表。 `.`:打开网页版 VS Code 或 CodeSpace 远程运行环境。 CodeSpace:在浏览器中申请远程运行环境(如双核 8GB 内存),直接调试代码。 Git Blame:查看每行代码的提交历史与作者。 最佳实践: 每次完成小功能点即 Commit,便于回溯。 项目初始化时立即创建 `.gitignore`。 多人协作优先使用 Revert 而非 Reset。 使用 WorkTree 进行并行开发以提高效率。

博主头像

🎬 Codex (APP) 保姆级全攻略,海量实战教程, 一期精通Codex

🛠️ 环境准备与基础安装 前置依赖:安装 Codex App 前需确保系统已安装 Git、Node.js 和 VSCode。 系统支持:支持 Windows 和 macOS,功能基本一致,但 macOS 独有 Computer Use(自动操作电脑)功能。 登录与初始化:支持 ChatGPT 免费账户登录,额度较低但可用。首次启动需选择工作场景(编程或日常),系统会预装相应插件和 Skills。 沙盒初始化:启动时需点击设置完成沙盒初始化,这是 Codex 权限系统的地基。 📂 多任务并行与界面布局 三栏布局:左侧为任务列表,中间为对话窗口,右侧为多功能区域。 项目关联:可将本地文件夹添加为项目,不同项目可并行执行任务。 并行执行:支持同时开启多个对话任务,任务状态通过图标区分(转圈表示运行中,绿标表示等待批准,蓝点表示完成)。 权限审批:涉及联网或修改沙盒外文件时,需用户批准或开启“自动审查”模式。 任务管理:支持对话归档、重命名、搜索标题(无法搜索内容),以及通过快捷键(Windows: Ctrl+N, Mac: Cmd+N)新建对话。 🛡️ 沙盒机制与权限控制 沙盒定义:Codex 将项目文件夹作为沙箱,默认拥有读写权限,但禁止修改沙盒外文件和联网。 底层实现:利用操作系统底层机制(如 macOS 的 Seatbelt)实现硬性限制,而非依赖模型自觉。 提权操作:如需突破限制,需发起 Escalator(提权)请求。 审查模式: 默认模式:所有提权需人工审核。 自动审查:推荐模式,由小模型自动审查低风险操作并放行,高风险操作才需人工介入。 完全访问:无视沙盒限制,风险极高,需谨慎使用。 上下文管理:显示上下文使用量,支持手动或自动压缩历史对话以释放空间。建议任务完成后开启新对话以清空上下文,提高专注力。 🎨 图像生成与 Steer 引导 AI 绘图:内置 GPT Image 2 模型,可生成网页配图。 Steer 功能:当 AI 执行方向错误时,用户可通过“引导”按钮(快捷键 Ctrl+Enter)中途接管,插入新指令纠正方向,无需等待当前任务结束。 指令队列:默认新指令排队执行,开启引导后可立即插入。 案例演示:在生成宠物店地图时,发现 SVG 效果不佳,通过 Steer 指令强制调用 AI 生图功能重新生成,成功替换网页图片。 📝 计划模式与代码协作 计划模式:开启后 Codex 先输出完整执行计划,经用户确认后再实施,适合复杂任务(如框架迁移)。 内置浏览器:任务完成后自动启动内置浏览器进行自动化测试,支持对页面元素进行批注和修改。 代码编辑:Codex 非传统 IDE,仅支持查看和批注代码,需借助 VSCode 等第三方 IDE 进行编辑。 Git 集成:支持初始化 Git 仓库、提交代码、推送到 GitHub。 回滚技巧: 对话分叉:通过 Fork 功能复制对话历史,剔除错误部分。 代码回退:在 VSCode 中复制 Commit Hash,指令 Codex 回退代码至该状态,实现对话与代码的双重回滚。 Git WorkTree:创建多个工作树(分支文件夹),实现并行开发互不干扰,完成后合并回主干。 ☁️ 云端运行与记忆系统 云端执行:代码同步至 GitHub 后,可选择关联 Codex Web,在云端环境执行任务(如修改代码、处理文件),支持手机端审批。 PR 流程:云端任务完成后生成 Pull Request,审核合并后同步回本地。 记忆系统: 项目级:在项目根目录创建 `agents.md` 文件,存储项目背景、用户偏好等,每次对话自动加载。 全局级:在设置中配置全局 `agents.md`,对所有项目生效(如禁止批量删除文件的安全提示)。 实验性记忆:可从聊天中生成记忆并带入新会话。 🧩 插件、Skills 与 MCP 插件市场:提供 GitHub、Gmail 等第三方插件,支持自动化任务(如定时发送邮件摘要)。 Agent Skills: 官方技能:如 Remotion(编程创建动画视频)。 第三方技能:如电子杂志风格 PPT 生成,需下载至 `.codex/skills` 目录。 自定义技能:使用 Skill Creator 将工作流(如视频字幕转 Markdown 图文笔记)封装为技能,包含截图占位符和脚本处理。 MCP 协议: 定义:模型上下文协议,标准化大模型与外部工具互动。 配置:通过设置添加 MCP 服务器(如 Supabase 数据库),需授权并重启 Codex。 应用:调用 Supabase MCP 创建数据库表、写入数据,实现前后端联动。 部署:使用 Netlify 插件将 Next.js 项目部署至公网,支持国内直连。 🖥️ 电脑自动化 (Computer Use) 功能限制:仅 macOS 支持,通过虚拟鼠标在后台操作电脑,不占用当前窗口。 应用场景: 自动打开聊天软件发送消息。 浏览 GitHub 看板汇总进度,生成简报并发送给老板。 结合自动化功能,设置每日定时执行上述流程。 注意事项:建议开启“防止系统休眠”开关以确保定时任务正常执行。

博主头像

🎬 新电脑,从零开始,跑通Claude Code等一切Agent 框架,覆盖三大操作系统

🖥️ Windows 环境配置 Node.js 安装:从官网下载 Windows 安装包,安装后在管理员终端执行 `node -v` 和 `npm -v` 验证版本。 Git 安装:下载对应 CPU 架构(通常为 x86 64 位)的安装包,安装后通过 `git --version` 验证。 Claude Code 配置:安装后修改 C 盘用户目录下的配置文件,填入国内大模型厂商的 API Key 和 Base URL,保存后启动并信任当前文件夹。 VS Code 安装:下载 Windows 安装包并安装,作为代码编辑工具。 GitHub 访问优化:安装开源软件 Word Toolkit,勾选 GitHub 并启动加速,解决国内网络超时问题。 Python 环境:通过 Python Install Manager 安装,使用 `py install 3.13` 安装指定版本,创建并激活虚拟环境以隔离依赖。 WSL 子系统:启用“适用于 Linux 的 Windows 子系统”和“虚拟机平台”,重启后执行 `wsl --install` 安装 Ubuntu 子系统。 Agent 部署:在 WSL 中安装 Hermes Agent,配置 OpenRouter API Key 并选择免费模型;安装 Codex 并登录 ChatGPT Plus 账号。 🍎 macOS 环境配置 浏览器替换:卸载 Safari,安装 Chrome 浏览器。 开发工具包:在终端执行 `xcode-select --install` 安装命令行工具,自带 Git。 Node.js 安装:避免使用官网安装包以防权限问题,使用 NVM 方式安装 Node.js 24 版本。 Claude Code 配置:创建 `.cloud.json` 配置文件,填入 API Key 和 Base URL,启动并授权。 GitHub 加速:安装 Word Toolkit,处理隐私与安全权限,执行终端命令解决权限错误后加速 GitHub。 Homebrew 安装:执行一键安装命令,利用其安装 Python 3.12。 Python 虚拟环境:修改 `.zshrc` 文件设置 Python 别名,强制使用虚拟环境安装依赖以避免全局安装报错。 Codex 配置:安装 Codex,通过 ChatGPT 官网或移动端获取 Plus 订阅并登录。 🐧 Linux (Ubuntu) 环境配置 系统更新:执行 `sudo apt update` 更新软件索引。 基础工具安装:通过 `sudo apt install` 安装 Curl 和 Git。 Node.js 安装:使用 NVM 方式依次执行命令安装 Node.js,验证版本号。 Claude Code 配置:安装后创建 `.cloud.json` 配置文件,填入 API Key 和 Base URL,启动并验证。 VS Code 安装:下载 `.deb` 格式安装包,通过 `sudo apt install` 命令安装。 Chrome 安装:下载国内版 `.deb` 安装包,通过终端命令安装。 💡 通用注意事项 网络环境:国内网络访问 GitHub 和 OpenAI 服务需使用加速工具或特定网络环境。 订阅获取:ChatGPT Plus 和 Claude 官方订阅需通过 Google Play 商店,将地区设置为美国并使用 Gmail 账号登录以规避验证。 虚拟环境:Python 依赖安装强烈建议使用虚拟环境,并在提示词中明确要求 Agent 使用虚拟环境,以避免依赖冲突。 API 配置:使用国内大模型厂商 API 时,需准确填写 API Key 和对应的 Base URL。

博主头像

🎬 告别一切重复枯燥任务,CLI+Skill搭建AI浏览器自动化框架

🎯 核心观点 提出“CLI + Skill”架构以替代传统 MCP 方案,实现浏览器自动化。 该方案能显著降低 Token 消耗,甚至实现零 Token 运行固定任务。 通过自然语言指令即可操作浏览器,无需掌握底层浏览器技术。 将重复性工作流沉淀为 Skill 或脚本,可提升效率并降低智能体参与成本。 📊 关键事实与论据 工具组合:使用 Playwright CLI 搭配 Skill,接入 Claude Code 或 Codex 框架。 性能对比:官方基准测试显示,Playwright CLI 比传统 Playwright MCP 方案减少约 4 倍 Token 消耗。 机制差异:MCP 将网页全量 DOM 或截图直接塞入上下文;Playwright CLI 仅输出摘要,按需读取本地快照文件或截图,节省上下文。 状态保持:使用 `--persistent` 参数可将 Cookie 和登录状态写入磁盘,避免重复登录。 效率实证: 抓取电商评论任务:首次无 Skill 指导消耗 41% 上下文窗口;第二次有 Skill 指导仅消耗 5%,效率提升近 10 倍。 固定流程脚本化:将评论抓取流程编写为 PowerShell 脚本后,直接执行即可零 Token 完成。 实战案例: X 平台发文:解决 Markdown 格式错乱及图片无法粘贴问题,通过脚本转换 HTML 并自动替换占位符图片。 Web App 测试:AI 阅读代码生成测试文档,自动执行注册、登录、上传简历等流程,验证功能并发现 Bug。 📝 结论与步骤 适用场景:电商数据抓取、社交媒体自动发布、Web 应用自动化测试等机械重复性任务。 实施步骤: 安装 Node.js、Playwright CLI 及 Chrome 浏览器。 在 Agent 框架(如 Claude Code/Codex)中安装 Playwright CLI Skill。 让 AI 执行复杂任务并记录过程。 将执行经验提炼为 Skill,优化后续执行效率。 对于完全固定的流程,让 AI 编写独立脚本,实现零 Token 自动化运行。 注意事项: 调试时建议添加 `--headed` 参数以可视化浏览器操作。 脚本编写需包含合理的延时与等待机制,确保任务稳定性。 Skill 需根据具体操作系统(如 Windows PowerShell)进行适配。

博主头像

🎬 为什么巨头都在做CLI(命令行界面)?比起MCP有哪些优势? #AI #CLI #Agent #科技

🎯 核心观点 CLI(命令行界面)正迎来新一轮爆发,被视为 AI Agent 的“母语”,因其天生适配大模型学习过的代码语料。 相比 MCP(模型上下文协议),CLI 在 Token 消耗、调试友好度及管道组合能力上具有显著优势,促使飞书、钉钉、谷歌、Stripe 等巨头开源 CLI 产品。 MCP 并非完全失效,在多租户及严格权限控制场景下仍优于 CLI,两者正互相学习融合。 📊 关键事实与论据 Token 效率:ScaleKit 测试显示,使用 GitHub 官方 CLI 相比 MCP,在所有任务中 Token 消耗成倍降低;CLI 支持渐进式披露,Agent 可随时调用 `-help` 学习用法,避免全量注入 Schema。 调试与复现:CLI 对人类和 Agent 均友好,报错后可直接复制命令在本地复现并协助修复;MCP 运行过程对人是黑盒,本地复现难,调试成本高。 管道能力:CLI 支持管道符串联命令(如筛选、排序、导出 CSV),轻松实现复杂流水线;MCP 处理同类任务需多次反复调用,增加时间与 Token 开销。 项目实测: CLI Anything:通过 7 步自动化流程将 Draw.io 等开源软件 CLI 化,耗时 46 分钟生成代码,成功实现自动绘制流程图。 OpenCLI:将网站或 Electron 应用转为 CLI,实测可查询 Hacker News 热榜、Boss 直聘职位,并支持二次开发新命令。 行业动向:Perplexity 于 2026 年 3 月宣布放弃 MCP 转向 CLI;OpenCloud 拒绝支持 MCP;社区热议“MCP 已死,CLI 永生”。 💡 结论与建议 适用场景: CLI:适合本地自动化、复杂任务流水线、需要人类介入调试的场景。 MCP:适合云端多租户、需要标准化安装包及统一鉴权规范的严格权限控制场景。 技术趋势:CLI 无法完全取代 MCP,但两者边界正在模糊。Claude Code 和 Codex 已引入 Tool Search 功能,按需加载 MCP;MCP Potter 等工具可实现 MCP 到 CLI 的转换。 操作建议:开发者可利用 CLI Anything 或 OpenCLI 快速将常用软件/网站接入 Agent 框架;在使用官方 CLI(如 GitHub CLI)时,建议先通过 `-help` 熟悉命令,利用管道符提升自动化效率。

博主头像

🎬 飞书官方插件一出,龙虾(OpenClaw)的玩法彻底变了

📌 核心观点 飞书凭借整合通讯、文档、多维表格等能力的完整 Workspace 属性,结合开放 API 生态及免公网 IP 的长连接方式,成为 Agent(龙虾/OpenClaw)最理想的 UI 外壳与工作台。 飞书官方插件的上线彻底改变了玩法,使 Agent 能够以用户身份直接操作飞书资源,解决了此前社区插件在权限配置上的复杂问题,实现了“养虾自由”。 📊 关键事实与论据 API 限额提升:3 月份起,免费版 API 调用次数限额提升至每月 100 万次,取消了对普通用户的次数限制。 权限机制变革:官方插件支持 Agent 直接以用户身份执行操作,如代替用户回复消息、创建文档。表格和文档的创建人及所有者显示为用户本人,而非机器人,彻底解决了权限归属问题。 配置简化:相比社区插件,官方插件配置更简单。安装后通过扫描二维码即可全自动创建机器人,无需复杂的前置配置。 功能覆盖: 多维表格:支持自然语言创建私人数据管理系统(如记账),可自动识别账单截图存入表格,并生成仪表板统计报表。 文档处理:能根据需求搜索合同模板并创建飞书文档,根据老板批注自动修改内容并发送摘要。 日程与通讯:可搜索聊天记录整理日报,查询多人日程并自动创建会议邀请。 ⚠️ 结论与注意事项 适用场景:适合使用飞书作为办公工具的用户,可实现自动化办公、数据管理及日程协调,充当“贴心秘书”角色。 风险提示:OpenClaw 整体仍处于初级形态,生态内功能存在不稳定和安全风险。 操作建议:在真实公司环境中使用前需充分评估风险,谨慎操作。演示中的企业为创建的小号,非真实工作环境。

博主头像

🎬 一期视频精通OpenClaw变高手,从中级到高级完整教程

🛠️ 环境部署与基础配置 安装前提:需先安装 Node.js,若网络无法连接 GitHub,需替换为备用安装命令;随后通过 npm 执行 OpenClaw 安装命令。 初始化设置:执行 `openclaw onboard` 进行初始化,建议选择 Coding Plan 对接模型供应商以节省 Token 成本(按次计费优于按 Token 计费);国内厂商如 MiniMax 支持 CN 站点授权。 权限修正:安装后需修改 `raw` 原始配置文件,将 `messaging` 下的默认配置改为 `for`,赋予其调用所有工具的权限,并执行 reload 生效。 🧠 记忆系统与文件结构 核心文件:记忆系统位于 `workspace` 文件夹,关键文件包括 `agents.md`(工作规范)、`identity.md` 与 `soul.md`(自我认知)、`user.md`(用户认知)、`tools.md`(工具调用知识)。 记忆机制:`memory.md` 存储长期记忆,`memory` 文件夹按天存放短期记忆;`heartbeat.md` 为心跳机制文件。 行为纠正:若 AI 行为不符合预期,可通过修改上述文件来纠正其行为逻辑。 🔍 联网搜索功能修复 原生缺陷:OpenClaw 原生搜索依赖 Brave API Key,配置繁琐且易报错(Missing Brave API Key)。 Skill 方案: Tavily Web Search:安装该 Skill 并配置免费 API Key(每月 1000 次额度),在 `openclaw.json` 中关闭默认搜索,并在 `tools.md` 中提示优先使用 Tavily。 Multi Search Engine:无需 API Key,直接调用多个搜索引擎,作为备选方案写入 `tools.md`。 效果验证:通过对话测试,AI 能正确读取 Skill 脚本并返回搜索结果,成功重构联网能力。 📚 Skill 获取与安装途径 内置 Skill:在设置页面启用 Built-in Skills,如 Apple Reminder(联动苹果提醒事项)、MCP Porter 等。 官方市场 CloudHub:收录 16000+ Skills,建议优先选择 Star 数量高且经过人工审核的项目,避免自动安装潜在恶意程序。 GitHub 开源项目:Awesome OpenClaw Skills 涵盖 5000+ 精选 Skill,按行业分类(如金融、营销),可复制名称在 CloudHub 搜索安装。 配置示例:安装 Summarize Skill 需配置 Gemini API Key,写入 `.env` 环境变量后重启即可使用。 💬 聊天工具接入(飞书与微信) 飞书接入: 步骤:安装飞书插件,执行 `openclaw chinoside` 添加配置;在飞书开放平台创建企业自建应用,获取 App ID 和 Secret。 权限配置:批量导入权限,开启机器人能力,选择长连接订阅方式,添加“接收消息”事件并发布版本。 心跳机制:在 `openclaw.json` 中配置 `heartbeat`(如每小时运行),并在 `heartbeat.md` 中定义具体指令(如检查金价),实现定时推送。 微信接入(云服务器方案): 部署环境:使用 Linux 云服务器,安装 Node.js 和 OpenClaw,通过 `openclaw gateway` 后台运行。 网络配置:通过 SSH 隧道建立本地连接,或配置公网 IP 及端口(18789)以支持企业微信回调。 企微配置:在企业微信后台创建应用,设置 API 接收 Token 和 AES Key,URL 指向服务器公网地址;在 OpenClaw 端安装插件并配置 App Token、AES Key、企业 ID 及 Secret。 最终效果:个人微信可通过企业微信机器人插件与 OpenClaw 对话。 🤖 多 Agent 功能 概念:Door Agent 功能允许在同一 OpenClaw 实例上运行多个具有不同性格、工具和记忆的机器人分身。 创建步骤:执行 `openclaw agents add` 命令,指定新的 Workspace 文件夹以隔离记忆文件;可选择复制现有配置。 绑定配置:在 `chinos` 配置文件中定义多个飞书账号(App ID/Secret),并在 `bindings` 中将不同 Agent 绑定至不同的飞书机器人账号。 个性化定制:修改特定 Agent 的 `soul.md` 文件以调整其性格(如林黛玉风格),重启后在飞书端即可看到两个独立且性格迥异的机器人。

博主头像

🎬 AI能剪视频了? 用Skills自动把课本例题转成科普动画

🎯 核心观点 结合编程工具与 Skills 技术,AI 已具备从零制作完整动画视频的能力,无需传统视频软件或素材。 通过 Remotion 框架将视频创作转化为 React 组件编写,契合 AI 擅长代码生成的优势,解决了 AI 操作复杂图形软件(如 AE、Premiere)的短板。 利用多 Skills 协作与 MCP 工具,可构建全自动 Agent,实现从课本例题提取到科普动画生成的全流程自动化。 🛠️ 关键事实与步骤 Remotion Skills 应用:下载 Remotion Skills 代码库并打包为 zip 文件,导入至项目设置中。在 Solo 模式下输入提示词,AI 自动初始化项目、创建 SVG 组件、安装依赖并启动浏览器预览。 素材优化:针对 AI 绘制复杂图形(如马)效果抽象的问题,替换为本地图片素材,显著提升视觉效果。 PDF 处理与 MCP 集成:引入 Anthropic 官方的 PDF Skill 处理教材文件。安装 GitHub 官方 MCP 并配置 Token,使 AI 能自动下载指定仓库中的高中物理必修二教材 PDF。 例题提取与动画生成:AI 调用 Python 脚本解析 PDF,定位圆锥摆例题。基于 Remotion Best Practice Skill 生成 3D 受力分析动画,经多轮交互修正箭头方向、小球运动状态及解题过程展示。 自定义 TTS Skill:利用内置功能创建名为 TTS 的 Skill,配置火山引擎 API 密钥。AI 调用该 Skill 生成解说音频,并自动调整动画时长以适配语音长度。 📊 结论 该方案成功搭建了“3 Skills + 1 MCP”的全自动视频生成 Agent,实现了从文本提示到专业科普动画的闭环。 多 Skills 场景下,模型能准确调用不同技能(如 PDF 解析、代码生成、语音合成),并主动编写脚本解决复杂任务。 最终产出的圆锥摆 3D 动画包含准确的受力分析(重力、拉力、向心力)及公式推导,验证了该工作流在科普教育领域的可行性与高效性。

博主头像

🎬 解构华为云AI Token服务: 可能是最好的DeepSeek大模型推理服务平台

🎯 核心观点 华为云 ModelArts Studio(MAS)是运行在国产算力巅峰的大模型推理服务平台,通过软硬协同优化,其 DeepSeek 模型推理性能达到国内顶尖水平。 平台明确划定业务边界,承诺不碰用户数据、不做流量应用、不抢客户生意,为企业提供了高确定性的技术底座和业务连续性保障。 华为云 MAS 不仅是 API 接口提供商,更是通过 MCP Server、RAG、Agent 等组件化能力,构建起类似“黑土地”的企业级应用底座。 📊 关键事实与论据 算力架构:接入 CloudMatrix 384 超节点,由 384 颗昇腾 NPU 与 192 颗鲲鹏 CPU 组成,利用 Matrix Link 高速网络实现一卡一专家调度,大幅降低通信占比。 性能数据:推理速度达到 H20 等主流 GPU 性能的 4 倍;单服务支持 4 万 RPM、600 万 TPM 级别推理能力;拥有 100 万张国产算力卡资源。 实测对比:在 Cherry Studio 中测试 DeepSeek V3.2,华为云首次时延 644 毫秒、每秒输出 37 Token;对比 DeepSeek 官方 API(902 毫秒/30 Token)和火山引擎(1048 毫秒/33 Token),华为云表现最优。 业务案例:某情感陪伴类 APP 在国庆期间业务暴涨 36 倍,在华为云实现从几百到几万的 RPM 弹性扩容,未触发限流。 安全合规:提供 IAM 身份认证、IP 白名单、多模态内容审核及 Prompt 攻击检测(拦截率 90%+),确保供应链安全。 生态适配:DeepSeek V3.2 开源当天完成适配上架;美团 Longcat 大模型原生支持昇腾并同步上架。 💡 结论 对于关注推理速度、高并发稳定性及业务连续性的 AI 架构师,华为云 MAS 提供了优于部分竞品的高性能推理服务。 该平台适合对数据合规性要求极高、担心供应商竞争风险的初创公司及中大型企业,其“只做底座”的定位降低了外部不确定性风险。 华为云通过全栈自研和快速适配国产大模型,构建了稳定的国产 AI 算力生态,成为国产大模型落地的重要基础设施。

博主头像

🎬 OpenClaw(Clawdbot) 海量全玩法攻略,本地部署,国内网络使用方法

📌 核心观点 OpenClaw(曾用名 Clawdbot)是一款运行在本地电脑的开源 AI 助理,GitHub Star 数已超 12 万。 其核心优势在于可接入多种聊天工具,实现远程指令执行与状态同步。 具备强大的“定身物”(Cron Job)系统,支持自然语言创建定时任务,具有主观能动性。 拥有长期记忆功能,通过本地文件存储记忆,随使用频率提升智能化程度。 支持接入国产模型(如 MiniMax)及飞书,解决国内网络环境下的使用痛点。 🛠️ 关键事实与操作 部署环境:推荐 Mac mini 或 Linux 服务器,需 Node.js 环境;Mac 优势在于桌面环境便于截图及生态绑定。 安装流程:通过 npm 安装,执行 `clawdbot onboard` 初始化;配置 AI 模型(如 OpenAI Plus 或国产模型)及聊天工具(如 WhatsApp)。 基础命令:`clawdbot gateway` 启动主程序;`clawdbot dashboard` 进入网页控制台;`clawdbot login` 重新登录掉线的聊天软件。 功能演示: 浏览器操作:自动打开浏览器搜索 MIT 公开课 Python 课件,下载至桌面并解压,最后发送文件。 定时任务:设置每日早晨 8 点生成 GitHub 热点中文简报并推送。 视觉能力:授予终端录屏权限后,可通过聊天指令实时截取 Mac 屏幕并发送。 飞书接入:安装飞书插件,配置 AppID 与 AppSecret,开启 WebSocket 模式;在飞书开放平台添加“接收消息”事件并发布版本。 国产模型配置:在 MiniMax 平台创建 API Key,通过 `clawdbot config` 配置模型,重启后切换生效。 生态扩展: GOG Skills:接入谷歌邮箱、日历等,需创建 OAuth 客户端并授权,可实现邮件总结、移动及发送。 MCP 集成:安装 MCP Porter,配置百度地图 MCP,实现路线规划查询。 编程驱动:安装 Coding Agent Skills,驱动本地 Codex 等工具,通过聊天指令生成贪吃蛇游戏代码。 💡 结论与建议 OpenClaw 适合需要远程办公、自动化处理日常事务及多生态集成的用户。 国内用户建议采用“飞书 + 国产模型”方案,以规避网络限制并提升响应速度。 部署时需注意系统权限(如录屏、浏览器控制)及 API 密钥的安全配置。 利用其长期记忆与定时任务功能,可构建个性化的智能工作流,实现从被动响应到主动服务的转变。

博主头像

🎬 OpenCode+全新工具链,开发识别鸟叫声手机APP #ai #科技 #教程 #编程 #人工智

🛠️ 核心观点 视频展示了一套基于 AI 的全栈 Webcoding 工具链,用于快速开发一款名为“文体鸟”的手机 APP。 该工具链结合了后端 Python 服务、前端设计生成、本地调试及跨平台打包技术,实现了从音频录制到鸟类识别的完整功能。 强调在 Linux 环境下使用命令行 AI 编程工具(如 OpenCode)具有跨平台迁移的便捷性与稳定性。 📝 关键事实与步骤 后端开发:使用 OpenCode 工具,配置 GPT Codex 模型,基于 Python FastAPI 构建后端。集成开源项目 Bird Night Analyzer(500 万参数 CNN 模型),支持全球 6000 多种鸟类声音识别。通过解析 `results.csv` 文件获取鸟种名称、学名及置信度,并返回 JSON 数据。 前端设计:利用谷歌 Stitch 生成 UI 设计稿,导入 AS Studio 后使用 Gemini 3 模型将设计图转化为可运行的网页代码。 调试与优化:在本地使用 VSCode 运行前端,解决 CORS 跨域问题(后端添加代码),修复录音按钮功能(从上传文件改为真实录音),并调整 UI 布局(移除喇叭图标、图片下方显示描述)。 打包部署:使用 Capacitor 将网页代码打包为 Android APP。在 Windows 11 虚拟机中安装 Android Studio,配置 HTTP 连接权限及录音权限,最终生成 APK 文件。 硬件环境:开发主机为摩尔线程发布的 ABook 算力本,运行原装 Linux 系统;打包环节使用内置的 Windows 11 虚拟机。 ✅ 结论 通过 Stitch、AS Studio、OpenCode 和 Capacitor 的组合,开发者无需编写原生代码即可实现接近原生体验的手机 APP。 该流程充分利用了 AI 在设计、代码生成及调试环节的能力,大幅降低了开发门槛和工作量。 最终成功在手机上安装并测试了“文体鸟”APP,实现了录制鸟叫声、AI 分析品种及展示图文知识卡片的功能。

博主头像

🎬 爆火的Skills怎么用?数据分析,内容创作,编程实战Agent Skills

📚 核心观点 Skills 是赋予 AI Agent 专业技能的封装包,本质为带目录的说明书,包含工作流、专业能力或规范。 相比传统 System Prompt 或 MCP,Skills 采用分层加载机制(元数据、指令、资源),能大幅降低 Token 消耗与提示词复杂度。 适用于数据分析、内容创作、编程等场景,可将重复性任务或固定提示词沉淀为可长期积累的能力。 🛠️ 关键事实与论据 结构分层:Skills 文件夹包含 `SKILL.md`(定义文件)及辅助脚本。`SKILL.md` 中由六个横杠包裹的元数据固定加载,指令层按需加载,资源层(如 Python 脚本)在需要时运行。 数据分析实战:使用 Anthropic 官方仓库中的“财报分析”Skill,处理 Meta 2025 年三季度财报。AI 调用 Python 脚本计算关键指标,并结合“Data Storytelling”Skill 将数据转化为故事线,最终通过 Notebook LM 生成 PPT。 自定义 Skill 开发:针对科技博主调研 GitHub 热门项目的需求,创建包含两个 Python 脚本(爬取数据、发送邮件)的 Skill。AI 自动执行爬取、总结翻译、生成 Markdown/HTML 报告并发送邮箱的全流程。 编程实战:使用“UI UX Pro Max”Skill,内置上百条行业设计规则。开发兽医网站时,AI 调用 `search.py` 查询行业标准,避免通用的蓝紫色配色,生成符合医疗行业色调(如蓝灰、橙色 CTA)的页面。 📝 结论与建议 适用场景:适合处理重复性数据分析、固定多步骤工作流或需要特定行业规范的任务。 实施步骤: 从 GitHub 等社区下载现成 Skills 或根据需求让 AI 生成。 将 Skill 文件夹压缩为 ZIP 包,通过 Agent 设置界面上传安装。 确保环境满足依赖要求(如 Python 3.12+)。 注意事项: 优先复用社区成熟 Skills 以提高效率。 自定义 Skill 时,明确工作流步骤及脚本功能(如数据获取、邮件发送)。 利用 Skills 的按需加载特性优化上下文窗口,提升输出稳定性与可靠性。

博主头像

🎬 OpenCode详细攻略,开源版Claude Code,免费模型与神级插件 #ai #科技 #计算

🛠️ 工具定位与安装配置 核心定位:OpenCode 是一款开源的 AI 编程工具,被视为 Claude Code 的开源替代方案,具备类似功能且对中国用户友好,无限速或封号风险。 四种形态:支持命令行、桌面客户端、IDE 插件(如 VSCode)及云端运行环境。 安装前提:命令行版需先安装 Node.js,通过 `npm` 命令安装;插件版需先安装命令行版,在 VSCode 扩展市场搜索安装后,通过命令面板启动。 客户端现状:桌面客户端目前处于 Beta 测试阶段,功能仅限基础对话框,Bug 较多,教程主要基于命令行版本演示。 🆓 免费模型与接入方式 内置免费模型:开箱即用,包括 GLM 4.7 和 MiniMax 2.1,适合新手练习 AI 编程及 Agent Skills、MCP、Subagent 等高级特性。 顶级模型接入: Gemini 3 Pro & Claude Opus 4.5:通过安装 "OpenCode Antigravity Auth" 插件,利用 Google Antigravity 提供的免费额度接入。需执行登录命令,选择 Google 登录方式并配置 Project ID。 GPT Codex:需拥有 ChatGPT Plus 及以上订阅,通过 `/connect` 命令选择 OpenAI 并登录,即可使用 GPT-5.2 Codex 等模型。 OpenRouter:通过 `/connect` 命令接入,支持 75 种 AI 供应商,只需填写 API Key 即可使用市面上几乎所有大模型,国内用户获取额度方便。 ⚡ 核心功能与高级用法 Session 并行处理:支持多 Session 后台并行运行。例如在开发“你画我猜”游戏时,可同时开启两个 Session 分别处理“增加计时器”和“调整画笔颜色”需求,互不干扰。 会话管理: `/share`:生成网页链接分享对话记录及文件修改历史。 `/export`:导出对话记录为文件。 `/timeline`:查看时间线检查点,支持 `revert` 功能,可将代码和聊天内容回退至任意历史状态。 Agent Skills 迁移:将 Claude Code 的 Skill 迁移至 OpenCode 只需将目录中的 `.cloud` 替换为 `.opencode`,放入项目文件夹即可被识别调用。 MCP 配置:支持 Local(本地命令执行,如 `npx`)和 Remote(远程 URL 调用,如 Context7)两种模式,需在 `opencode.json` 配置文件中定义。 🚀 插件生态与智能体调度 OMY OpenCode 插件: 组成:集成 LSP、AST、Locad 等工具,内置 WebSearch、Context7、GitHub 搜索等 3 个 MCP Server,以及 7 大编程智能体(如主智能体 Sisyphus、架构师、前端工程师等)。 模型分配:为不同智能体分配最适合的模型,例如前端工程师使用 Gemini 3 Pro,主智能体使用 Claude Opus 4.5。 安装:复制 GitHub 首页的 Install 提示词粘贴至 OpenCode 自动安装,需回答关于订阅情况的问题。 Ultra Work 模式:输入魔法词 `ulw`,插件会调用所有潜能,将任务拆分并分配给多个智能体并行执行,由主智能体居中调度。 Ralph Loop 模式:输入 `rough-loop` 命令,强制 AI 长时间循环工作,直至完成高难度任务(如重构项目直到测试通过),可运行数小时。 ☁️ 云端集成与自定义扩展 GitHub 集成: 功能:在 GitHub Issue 中输入 `/opencode`,可在云端自动解释问题、修复 Bug 并创建 Pull Request。 配置:需将项目上传至 GitHub,执行安装命令,配置 API Key(如 Google AI Studio 密钥)至 Repository Secrets。 自定义命令与智能体: 自定义命令:在配置文件夹新建 `command` 目录,以 Markdown 文件定义命令,指定 Build 或 Plan 模式。 自定义智能体:在 `agent` 目录新建 Markdown 文件,定义描述、类型(Primary 或 Subagent)及模型。Subagent 可由主智能体后台调度,Primary 可通过 Tab 键直接切换。 其他命令: `/init`:通读项目生成 `agents.md` 系统提示词。 `/compact`:压缩上下文,释放模型窗口。

博主头像

🎬 Agent Skills (Claude Skills) 详细攻略,一期视频精通

📚 Agent Skills 核心概念与机制 定义:Agent Skills 是一种带目录的说明书,本质是渐进式披露提示词的机制。 结构分层:将提示词分为三层,包括必定加载进上下文的元数据(类比目录)、按需加载的指令层(类比正文)以及资源层(类比附录)。 核心优势:相比传统 Prompt 或 MCP,Skills 通过按需加载大幅降低了 Token 消耗与提示词复杂度。 标准化进程:2025年12月18日,Anthropic 正式将 Agent Skills 发布为开放标准,使其像 MCP 一样朝通用跨平台规范方向发展,Codex、Cursor、OpenCode 等工具已陆续加入支持。 🛠️ Claude Code 配置与基础实战 环境配置:在 Claude Code 中,Skills 以文件夹形式存放在项目目录的 `.claude/skills` 中,每个 Skill 文件夹必须包含大写的 `SKILL.md` 定义文件。 文件结构:`SKILL.md` 包含元数据(用六个横杠包裹,含名称和描述)和指令层(Markdown 格式的详细指令);文件夹内可存放脚本、文档等资源文件。 调用流程: 用户提问后,Claude Code 扫描所有 `SKILL.md` 提取元数据形成技能列表。 AI 根据元数据判断是否调用特定 Skill。 确认后,Claude Code 加载该 Skill 的指令细节发送给 AI。 AI 综合信息生成回答或执行后续操作。 全局生效:将 Skill 文件夹复制到用户目录下的 `.claude` 配置目录中,即可在所有项目中生效。 🔄 跨工具迁移与资源层进阶 Codex 迁移:将 Claude Code 的 Skill 文件夹路径从 `.claude` 改为 `.codex` 即可在 Codex 中使用,需在 Codex 配置文件中开启实验性 Skills 功能。 资源层应用: 脚本执行:在 `scripts` 子文件夹存放可执行脚本(如 Python 调用 FFmpeg 截图),AI 仅执行脚本而不加载代码内容,进一步降低上下文占用。 参考文档:在 `references` 子文件夹存放范文或补充说明,AI 根据指令按需读取以学习风格或获取背景知识。 社区资源:GitHub 上的 Awesome Claude Skills 项目拥有 14000 Star,提供大量现成 Skill 包,直接拖拽文件夹即可使用。 ⚖️ Skills 与 MCP 对比及协作 核心区别: Skills:侧重提示词管理,主体为 Markdown 文本,编写难度小,Token 消耗低,但脚本执行受本地环境(如 Python 版本)影响较大。 MCP:侧重工具调用,主体为 Node.js 或 Python 编写的软件包,执行成功率高,但编写难度大,且提示词一次性塞入上下文导致 Token 消耗较高。 协作模式: 分工:Skills 负责披露提示词和管理逻辑,MCP 负责具体的工具调用(如 GitHub API 操作)。 实战案例:在“帮我写作”Skill 中,AI 先根据 Skills 指令学习风格并生成文案,随后调用 GitHub MCP Server 的 `CreateRepository` 和 `CreateOrUpdateFile` 工具,自动创建仓库并上传文件,实现从内容生成到云端备份的完整闭环。

博主头像

🎬 为什么React的漏洞能攻破服务器?NextJs与RSC入门基础

🛡️ 核心观点 React 已演变为具备前后端一体能力的全站架构,其服务器端组件(RSC)漏洞可直接威胁服务器安全。 CVE-2025-55182 是评级为 10 分的最高危险级别漏洞,攻击者无需授权即可通过公开地址在服务器执行任意命令。 Next.js 作为唯一在生产环境完整支持 RSC 的框架,是该漏洞影响最大的重灾区。 开发者需严格区分服务端与客户端代码,避免将敏感数据(如 API Key)暴露在前端,尤其在 AI 辅助编程时需警惕架构混淆带来的安全隐患。 🔍 关键事实与论据 漏洞原理:React 使用 Flat 协议序列化数据,攻击者利用对象引用关系找到圆形对象,进而访问 Function 构造器创建并执行恶意函数。 复现条件:Next.js 15 或 16 版本(含空白项目)均受影响;Next.js 16.0.7 及 React 19.2.1 已发布修复补丁。 RSC 特性:组件代码在服务器运行,仅传递 HTML 结果给客户端;相比传统前后端分离,RSC 减少 JS 传输、加快加载速度并保护数据库逻辑隐私。 组件区别:服务端组件默认无需声明;客户端组件需添加 `use client` 声明。服务端可嵌套客户端组件,反之则不可。 修复措施:官方修复方法为限制对象引用时仅读取自有属性,阻止对原型或构造器的访问。 📝 结论与建议 版本升级:立即将 Next.js 升级至 16.0.7 或更高版本,React 升级至 19.2.1 以封堵漏洞。 架构理解:开发者应从代码细节转向架构设计与框架理解,明确代码执行环境(服务器或客户端)。 安全实践:严禁在客户端组件中硬编码敏感信息;利用 RSC 特性将数据查询逻辑保留在服务器端,仅向浏览器返回最终 HTML。 AI 协作警示:AI 编程可能混淆前后端代码边界,开发者必须人工审查代码执行位置,确保敏感逻辑不泄露至前端。

博主头像

🎬 把Gemini3生成的网页应用,打包成手机APP,手把手教程,混合APP开发入门 #ai

📱 核心观点 视频演示了将基于 Web 的 AI 生成应用(以 3D 跑酷游戏为例)转化为移动端应用的三种主要路径:PWA(渐进式网页应用)、Android APK 和 iOS IPA。 强调客户端安全原则:严禁在网页或手机 APP 前端代码中直接暴露 API Key,必须通过后台服务器中转请求以保护密钥安全。 指出 PWA 虽具备离线使用和全屏体验,但本质仍是网页;而 Capacitor 框架能打包出更接近原生体验的独立 APP,且一套代码可适配多平台。 🛠️ 关键步骤与事实 前期适配:在 Google AI Studio 中生成应用,通过对话指令让 AI 添加虚拟按键以适配手机触控操作,并修复显示问题。 部署准备:将代码保存至 GitHub,在 `index.html` 中引用 React 入口文件,使用 Netlify 进行免费部署,配置环境变量(纯前端项目可随意填写 API Key 占位)。 PWA 改造: 使用 `npm install -D vite-plugin-pwa` 安装插件。 在 `public` 目录放置应用图标。 利用 AI 工具(如 Codex)修改 Vite 配置文件,定义应用名称、全屏显示模式及主题色。 构建后生成 `manifest` 文件和 `sw.js`(Service Worker),实现资源缓存与离线运行。 Android 打包: 基于不含 PWA 改动的代码分支,安装 Capacitor 依赖并初始化工程。 执行 `npm run build` 编译前端,`npx cap sync` 同步网页至安卓工程,`npx cap add android` 创建安卓目录。 通过 Android Studio 导入工程,使用 Debug 模式测试,最终生成 APK 文件安装至真机。 iOS 打包: 前提需拥有 Mac 电脑及 Xcode 开发环境。 执行类似安卓的命令安装 Capacitor 依赖,添加 iOS 目录。 需额外安装 CocoaPods 工具,同步网页后通过 `npx cap open ios` 打开 Xcode。 调试版 APP 有效期仅 7 天,长期使用需上架 App Store。 ⚠️ 结论与注意事项 PWA 优势:无需应用商店审核,安装便捷,支持离线使用,启动速度快,适合快速分发。 原生 APP 优势:体验更接近原生应用,功能限制较少,但开发流程复杂,iOS 端受限于 Mac 环境和签名机制。 安全警示:涉及真实 AI 功能(如调用 Gemini 3 Pro 生成 SVG)时,必须部署后台服务。前端仅发送请求至后台,由后台附加 API Key 后再调用 AI 接口,避免密钥泄露。 环境依赖:Android 开发需 Android Studio 及良好网络环境下载依赖;iOS 开发强制要求 macOS 系统,Windows 无法直接开发 iPhone 应用。

博主头像

🎬 把Gemini3生成的应用,免费部署成自己的网站,别只会在AI Studio里玩了

🎯 核心观点 针对 Gemini 3 生成的应用,需根据是否包含 AI 功能选择不同部署策略。 纯前端应用可直接部署至静态托管平台,但需警惕 API Key 泄露风险。 含 AI 功能的应用必须通过后端代理或网关机制保护 API Key,避免直接暴露在前端代码中。 国内用户需关注部署平台的网络连通性,部分平台域名无法直连,需绑定自有域名或选择支持直连的平台。 🛠️ 关键事实与步骤 部署平台分类: 静态托管:Vercel、Netlify、Edge One Pages。适用于无 AI 交互的纯前端项目(如 React 应用)。 云托管:谷歌云(Cloud Run)。适用于需调用 AI API 的项目,利用网关自动附加 API Key,保护密钥安全。 纯前端部署流程: 在 AI Studio 生成应用并保存至 GitHub。 修改 `index.html` 引入 React 入口文件。 在部署平台(如 Vercel/Netlify)导入 GitHub 仓库。 设置环境变量 `Gemini API Key`(纯前端项目可填假值,因不涉及实际调用)。 部署后,若平台域名国内无法直连,需绑定自有域名。 含 AI 功能部署方案: 方案一(谷歌云):直接部署至 Cloud Run,系统自动生成 API Key 并通过网关转发请求,浏览器端不可见密钥。前提:谷歌云账户需绑卡并设置结算信息。 方案二(前后端分离):将项目改造为 Next.js 应用,API Key 仅存于后端 `.env.local` 文件。 克隆项目至本地,使用 AI 辅助改造为 Next.js 结构。 本地测试通过后,推送至 GitHub。 在 Vercel 部署时,环境变量中填入真实的 Gemini API Key。 请求流程:浏览器 -> 后端 API -> Gemini API,密钥不暴露在前端。 技术细节: 纯前端项目严禁将真实 API Key 写入代码,因浏览器源码公开可见。 改造为 Next.js 后,需删除无用文件以修复部署错误。 使用 Gemini 3.0 Pro 模型需使用付费层级的 API Key,免费层级不支持。 ⚠️ 结论与注意事项 安全性:保护 API Key 是部署含 AI 功能应用的核心,必须通过后端或网关隔离密钥。 可用性:Vercel 默认域名国内无法直连,Netlify 和 Edge One Pages 生成的域名国内可直连。 成本与功能:当前方案未包含用户鉴权和支付系统,若需商业化使用,需额外集成 Supabase 或 Stripe 等服务以实现积分购买和账号管理。 前提条件:使用谷歌云部署需完成绑卡;使用 Gemini 3 模型需具备付费 API Key 权限。

博主头像

🎬 Obsidian邪修用法,免费云同步,AI,手机端,还有进阶技巧

🛡️ 核心优势与数据策略 选择理由:数据安全、界面丝滑流畅、与 AI 工具高度兼容。 数据本质:笔记本质为本地独立的 Markdown 文件,即使软件停止维护,文件仍可通过其他编辑器读取,具备极高的安全感。 备份方案:使用 GitHub 进行云端同步与备份。GitHub 作为代码托管基础设施,其稳定性优于普通网盘或云笔记软件。 安全设置:创建仓库时必须选择 Private(私有)可见性,防止笔记公开泄露。 冲突规避:通过 `.gitignore` 文件排除 `workspace.json` 等频繁变动的配置文件,避免 Git 提交冲突。 🔄 云同步与自动化配置 基础流程:通过 GitHub Desktop 克隆远程仓库至本地,将 Obsidian 库指向该文件夹。 自动化插件:安装 Git 插件,配置 `Auto commit and sync after stopping file edits`,设定停止编辑 1 分钟后自动同步。 启动同步:开启 `Pull on Setup`,确保每次启动 Obsidian 时拉取远端最新改动,保持本地与 GitHub 一致。 多端同步:手机与电脑均可通过 Git 同步,但需注意避免同时编辑同一文件以防冲突。 🤖 AI 集成与效率提升 工具选择:推荐使用 Gemini CLI 等 AI 编程工具,因其擅长处理本地 Markdown 文件,且模型适配度优于社区插件。 环境准备:需安装 Node.js,并在笔记目录终端执行安装命令。 应用场景: 选题生成:让 AI 生成 10 个选题及大纲,并自动创建对应的子文件夹结构。 风格模仿:基于过往笔记学习行文风格,辅助撰写视频脚本或文章。 文件管理:批量整理文件夹、查找笔记。 风险控制:利用 Git 的历史记录功能,若 AI 修改出错,可通过 `Discard Changes` 还原至修改前状态,确保数据安全。 🖼️ 图片存储标准化 原生缺陷:Obsidian 默认图片存储位置混乱,且链接非标准 Markdown 语法,导致在 GitHub 网页端或 VSCode 中无法正确渲染。 解决方案: 安装 `Custom Attachment Location` 插件。 设置 Markdown URL 格式,启用附件重命名。 在系统设置中关闭“使用维基链接”,选择“基于当前笔记的相对路径”。 效果:图片自动存入与笔记同名的子文件夹,链接符合标准 Markdown 语法,支持跨平台(GitHub、VSCode)正常显示,且重命名笔记时链接自动更新。 📱 移动端与导出技巧 手机同步:通过数据线将笔记文件夹复制到手机,在 Obsidian 中打开该文件夹作为 Vault。 Token 配置:在 GitHub 开发者设置中生成 Personal Access Token(建议永不过期,勾选 Repository 权限),填入手机端 Git 设置中以实现自动推送。 格式导出:安装 `Enhancing Export` 插件,配置 Pandoc 路径(需下载并解压 Pandoc 可执行程序),即可将笔记导出为 Word 或 HTML 格式,且能正确保留配图。 知识图谱:利用双向链接功能,通过 `[[ ]]` 语法关联笔记,查看关系图谱以发现知识间的隐藏关联,辅助灵感迸发。

博主头像

🎬 前端读写数据库?能安全吗? 一期视频精通Supabase,顶级后端开源项目,实战教程+本地部署

🏗️ Supabase 核心架构与定位 项目定义:Supabase 是一个开源的后端即服务(BaaS)框架,基于 PostgreSQL 数据库构建,GitHub 星标数达 9 万,属于顶级开源项目。 功能模块:提供数据库、文件存储、边缘函数、用户认证及可视化运维面板,旨在为开发者提供开箱即用的后端基础设施。 接入方式:支持前端 SDK 快速集成 React、Vue 或移动端应用;提供云服务版本(免费实例)及本地自部署方案(Docker 镜像)。 核心价值:结合 AI 编程工具,可快速搭建包含用户认证和数据库的前后端完整应用。 🗄️ 数据库功能与插件扩展 基础能力:具备 PostgreSQL 的所有原生功能,包括 Schema、表、函数、触发器及插件管理。 插件示例:通过安装 PostGIS 插件,PostgreSQL 可存储地理位置信息(如公园面积、河流距离),替代传统 GIS 系统,简化了服务器软件包安装流程。 连接模式: Direct Connection:直连模式,不支持 IPv4,需后端自行维护连接池(如 Hikari)。 Session Pooler:类似直连,支持 IPv4。 Transaction Pooler:连接池模式,由 Supabase 自动维护连接池,适合无状态服务(如边缘函数),降低数据库连接压力。 🔐 RLS 行级安全策略机制 核心原理:RLS(Row Level Security)是 PostgreSQL 原生功能,用于约束特定用户可读取或修改的数据行,确保前端直接操作数据库时的安全性。 配置步骤: 创建业务表(如 UserInfo),关联系统用户表(auth.users)的外键。 启用 RLS 并创建策略(Policy),例如限制用户仅能查看 `user_id` 匹配自身 ID 的数据。 未配置 RLS 的表通过 SDK 无法查询,仅能通过后台直连访问。 安全验证: 读取限制:前端查询他人数据时返回空结果,网络请求中 JWT Token 与 RLS 策略匹配才允许访问。 写入限制:尝试插入非本人 `user_id` 的数据时,系统返回 403 Forbidden 错误,阻止越权写入。 API Key 安全性:在启用 RLS 的前提下,将 API Key 暴露在前端代码中是安全的,因为数据访问权限由后端策略严格控制。 📂 文件存储与实时功能 Storage 功能: 支持创建存储桶(Bucket),兼容 S3 标准协议,可用作图床或文件管理。 安全策略:可配置策略限制用户仅能操作与其 User ID 同名的文件夹,防止越权上传。 免费额度:云服务版本限制数据库 500MB,存储桶 1GB。 Realtime 功能: 基于 WebSocket 推送数据库变化,可配置触发器监听表数据变动。 应用场景:客户端实时弹窗提醒、消息通知等。 Edge Functions:功能类似 Cloudflare Workers,用于执行边缘计算任务。 🚀 本地部署与自托管指南 部署前提:需安装 Docker Desktop,服务器内存建议至少 4GB(因包含 13 个组件)。 部署步骤: 克隆 Supabase 源码至本地。 将 `docker` 目录下的文件拷贝至项目文件夹。 复制 `env.example` 为 `.env` 文件,修改前端端口(如 Windows 下改为 18000)以避开冲突。 执行 `docker compose pull` 拉取镜像,再执行 `docker compose up -d` 启动所有容器。 访问配置: 本地访问地址为 `localhost:18000`。 默认账号为 `supabase`,密码需从 `.env` 文件中获取。 SDK 适配:将前端代码中的 Supabase URL 和 API Key 替换为本地部署实例的地址和密钥,即可正常使用数据库、存储及认证功能。 开源协议:采用 Apache 2.0 协议,允许免费商用。

博主头像

🎬 用过上百款编程MCP,只有这15个真正好用,Claude Code与Codex配置MCP详细教程

🛠️ 核心观点与MCP定义 MCP本质:模型上下文协议(Model Context Protocol),被定义为AI的标准化工具箱,使AI能与外部系统对话并代替人类执行操作。 工具筛选标准:在试用上百款编程类MCP后,仅筛选出15个真正好用的工具,主要集中在编程领域。 配置原则:MCP Server并非配置越多越好,每增加一个都会占用上下文,建议“用哪个配置哪个”。 演示环境:使用热度最高的两个AI编程工具 Claude Code 和 Codex 进行实战演示。 🌐 浏览器自动化与调试 Chrome DevTools MCP:由谷歌官方开发,无需安装浏览器插件,只要电脑安装过Chrome即可直接使用,终结了社区开发MCP配置麻烦的问题。 功能演示: 基础操作:自动打开GitHub、搜索项目并点击Star。 调试能力:读取控制台报错和网络请求,精准定位代码错误(如将PUT请求改为POST)并自动修复。 配置差异: Claude Code:支持项目级或用户级(`--scope user`)配置。 Codex:需修改 `config.toml` 文件,Windows配置较繁琐,macOS可简化命令。 🗄️ 云端数据库集成 Neon MCP:基于Postgres的免费云端数据库。 功能:让AI瞬间获得数据库操作能力,支持创建Project、建表、插入数据。 配置:Claude Code需授权登录;Codex需配置HTTP或NPX方式,Windows与macOS配置略有不同。 Supabase MCP:功能比Neon更强大,封装了用户认证、文件存储、可视化运维面板等后端基础设施。 功能:支持创建业务表、生成Next.js登录注册页面、自动填写环境变量(URL和API Key)。 配置:通过HTTP远程调用,需在浏览器完成授权。 🎨 设计稿转代码 Figma MCP:将Figma设计稿对接到Coding Agent,实现一句话生成网页。 配置难点:参数复杂,需先在命令行安装基础包,再手动编辑配置文件填入Figma API Key和STDIO参数。 效果:AI获取设计稿结构信息和图片,生成的Next.js登录页面与原始设计稿相似度约九成。 📚 文档检索与知识补充 Context7 MCP:帮助AI查找文档,补充最新编程知识(如Python 3.14的T字符串特性),解决大模型知识截止日期的问题。 Ref MCP:功能类似Context7,但更灵活,支持从论文、GitHub仓库等冷门地方进行文档深入检索。 🖼️ 图片生成与部署 Replicate MCP:用于生成AI图片,改善产品原型美观度。 案例:为热气球网站生成6个销售套餐的配图,图片与套餐内容贴合。 配置:需在配置文件中填入Replicate API Token。 Vercel MCP:免费部署平台,Next.js框架的绝配。 功能:一键部署项目、查找团队项目信息。 限制:预览域名仅在国外网络环境可见。 其他部署平台: Edge One Pages:国内类似的免费部署平台,提供MCP工具。 Cloudflare:提供多种MCP Server,涵盖文档查找、Worker部署、日志监控、全球流量查询等,几乎所有API功能均被整合。 🔗 开发流程与安全 GitHub MCP:由GitHub官方推出,连接AI与GitHub平台。 功能:读取资源库、管理Issue、创建Pull Request(PR)、分析代码。 案例:AI读取Issue中的Bug描述,本地修改代码,并自动创建PR推送修改。 配置:需填入GitHub API Token,支持HTTP传输。 Stripe MCP:对接收款服务平台。 功能:从Stripe获取商品信息,生成支付页面,完成测试环境支付流程。 Shadcn MCP:前端组件库集成。 功能:AI自动查找组件代码并复制到项目中,如生成Button组件。 Semgrep MCP:安全静态分析工具。 功能:内置5000多条安全规则,对项目进行整体安全漏洞扫描。 结果:演示项目中未发现安全问题。 🛠️ 自定义MCP开发 官方SDK:GitHub MCP官方仓库提供多种SDK,支持使用Python等语言创建属于自己的MCP Server。 建议:别人的工具再好不如自己的好用,鼓励开发者根据具体需求定制MCP。

博主头像

🎬 AI编程新王Codex详细攻略,一期视频精通,附免费使用方法

🎯 核心观点 Codex 凭借低成本、对中国用户友好及稳定的服务,热度超越 Cloud Code。 视频旨在提供 Codex 的完整教程,涵盖 CLI、IDE 插件、SDK 及云端四种运行环境。 通过接入国产免费模型,用户可在无 ChatGPT 订阅的情况下使用 Codex。 实测显示,GPT-5 模型在编程效果上优于 GPT-5 Codex 及 GLM-4.6,且与 Cloud Code 表现持平。 🛠️ 关键事实与步骤 环境配置:需安装 Node.js,通过 GitHub 命令安装 Codex CLI。 免费接入:利用摩达社区每日 2000 次免费 API 调用,在 `config.toml` 中配置 Base URL 及环境变量,实现免费使用。 模型对比:在“你画我猜”案例中,GPT-5 得分 97 分,GPT-5 Codex 得分 95 分,GLM-4.6 因黑屏 Bug 得分 80 分。 核心命令: `/init`:生成 `agents.md` 文件以优化上下文理解。 `/compact`:压缩对话上下文,降低 Token 消耗。 `/new`:开启新对话并清除历史。 `/approvals`:调整权限档位(只读、自动、完全访问)。 MCP 集成:支持安装 Context7 和 Excel MCP Server,Windows 与 macOS 配置格式不同,需根据系统调整 `config.toml`。 自定义命令:在 `prompts` 文件夹创建 `.md` 文件,支持参数化自定义指令(如 `git_diff`)。 IDE 插件:VS Code 插件支持可视化文件对比、一键撤回(Undo)及图片粘贴,配置与 CLI 互通。 云端运行:基于 GitHub 仓库,支持后台并行任务、自动创建 Pull Request 及自动代码审核(Code Review)。 SDK 开发:通过 `npm init` 和安装 SDK,可在 Node.js 工程中调用 Codex 能力,需配置跳过 Gate 安全检查。 ⚠️ 结论与注意事项 性能优势:ChatGPT Plus 会员额度充足,个人使用极少触发速率限制,且封号风险低于 Cloud Code。 模型选择:官方 GPT-5 模型表现最佳;使用自定义免费模型时,若出现修改文件 Bug,需手动指定使用 `ApplyPatch` 工具或优化提示词。 适用场景: 追求极致编程效果且预算充足者,推荐 GPT-5 模型。 预算有限者,可接入国产免费模型,但需容忍部分功能瑕疵。 团队协作或远程开发,推荐云端运行环境及自动代码审核功能。 操作风险:Windows 系统配置 MCP 时格式较复杂,需严格遵循特定配置模板;云端操作需确保项目已上传至 GitHub。

博主头像

🎬 赛博善人出新品!中国区友好的免费全栈部署平台,AI编程绝配

🎯 核心观点 腾讯云 Edge One Pages 是一款面向开发者的免费全栈部署平台,主打“只管写代码,自动搞定构建、部署、运维”的极简体验。 该平台对 AI 编程工具(如 Cloud Code)及 Node.js 生态(Next.js、Express)有深度适配,被视为 AI 编程的“绝配”。 相比海外同类产品,Edge One Pages 在中国大陆拥有节点优势,访问速度显著更快,且免费包含全球 CDN 加速与安全防护。 📊 关键事实与论据 技术兼容性:完整兼容 Node.js,原生支持所有 Node.js API 及 NPM 包;深度适配 Next.js 框架;支持 Express 后台框架(需改造为 Node Functions 结构)。 部署方式:支持通过 GitHub 仓库导入或直接上传 ZIP 压缩包两种部署方式;支持配置环境变量(如 API Key、数据库连接串)。 性能对比数据:在相同网站测试中,Cloudflare Pages 平均访问时间为 0.83 秒,而 Edge One Pages 平均响应时间为 0.197 秒,主要得益于其覆盖中国大陆的边缘节点。 功能集成:免费分配域名,支持自定义域名 CNAME 解析;集成 CDN 缓存静态资源(JS、CSS、图像等);提供安全防护功能。 AI 自动化能力:通过 MCP 工具,AI 可全自动完成从代码部署到上线的流程,无需人工干预控制台操作。 💡 结论与建议 适用场景:适合使用 Next.js、Express 等 Node.js 技术栈的开发者,特别是希望快速上线 SaaS、电商或博客类全站项目的用户。 操作建议: Next.js 项目:上传至 GitHub -> 在 Edge One Pages 导入仓库 -> 配置环境变量 -> 自动部署。 Express 项目:需将代码结构调整为 Node Functions 规范(如重命名文件夹、调整路由文件命名),打包 ZIP 后上传部署。 AI 辅助:安装 Edge One Pages MCP 插件,通过 AI 编程工具直接指令部署,实现端到端自动化。 优势总结:零成本享受全球 CDN 与安全服务,中国大陆访问速度优于海外竞品,极大降低了应用上线的运维门槛。

博主头像

🎬 为什么PostgreSQL能超越MySQL,有哪些优势?PostgreSQL登顶最受欢迎的数据库

📊 索引机制与查询性能 基础架构差异:MySQL 采用聚簇索引,数据直接存储在 B+ 树叶子节点,非主键查询需回表;PostgreSQL 采用堆表存储数据,所有索引(包括主键)均为二级索引,存储指向堆表的指针,索引与数据分离,避免随机写入导致的数据页分裂。 GIN 索引:PostgreSQL 支持通用倒排索引,适用于 JSONB 数据及全文检索,能高效处理包含关系查询;MySQL 不支持 GIN 索引。 GiST 索引:PostgreSQL 提供通用搜索树框架,支持非线性数据(如几何图形、日期范围)的重叠与距离查询;MySQL 不支持 GiST 索引,且缺乏日期范围数据类型。 部分索引:PostgreSQL 支持基于条件的部分索引(如仅对 Active='Y' 生效),有效解决逻辑删除导致的唯一索引冲突,且索引体积更小;MySQL 仅能通过生成列或表达式索引变通实现,性能与磁盘占用表现不如部分索引。 表达式索引:PostgreSQL 原生支持对列计算结果(如邮箱转小写)建立索引;MySQL 8.0.13 后支持,但本质是生成隐藏虚拟列再建索引。 🛡️ 数据一致性与事务管理 DDL 事务支持:PostgreSQL 将表结构修改(DDL)视为系统表数据操作,支持在事务中回滚建表或改表操作,保证原子性;MySQL 无法将 DDL 语句纳入事务管理。 可延迟约束:PostgreSQL 支持在事务提交时才检查约束(如唯一性),解决复杂场景下的“先有鸡还是先有蛋”问题;MySQL 无此功能。 隔离级别行为: PostgreSQL 默认“读已提交”,读写操作基于同一快照,行为符合直觉。 MySQL 默认“可重复读”,存在读写行为不一致问题:Select 读取事务开始时的快照,而 Update 读取当前最新数据(非快照),可能导致逻辑矛盾;且高并发下存在间隙锁性能退化问题,大厂实践常建议降级为“读已提交”。 🚀 性能对比与版本趋势 高并发写入:在每秒 1 万次写入场景下,PostgreSQL 性能约为 MySQL 的 2 倍,且在内存、CPU、硬盘占用上均占优。 高并发查询:在 7000 万数据量、每秒 2 万次查询场景下,PostgreSQL 性能约为 MySQL 的 1.5 倍。 版本演进趋势:MySQL 从 5.7 到 8.0 再到 8.4,性能呈下降趋势;PostgreSQL 最新版本相比 6 年前的 PostgreSQL 10 版本,性能提升 30% 至 70%。 🧩 扩展性架构对比 扩展维度:PostgreSQL 支持数据类型、函数、操作符、索引类型四大维度的扩展;MySQL 主要依赖可插拔存储引擎,但实际应用中 99% 使用 InnoDB,其他引擎缺乏维护。 自定义能力: PostgreSQL 支持自定义数据类型、操作符及索引类型。 MySQL 不支持自定义数据类型和操作符。 生态规模:截至 2025 年,PostgreSQL 社区第三方插件数量为 375 个,MySQL 为 47 个。 PostGIS 案例:利用 PostgreSQL 扩展机制构建地理信息系统,无需修改核心代码,通过自定义类型(Geometry)、函数(ST_area)、索引(GiST)及操作符实现高效空间查询。 ⚖️ 开源协议与社区生态 许可证差异: PostgreSQL 采用类似 MIT/BSD 的宽松协议,允许自由使用、修改、分发及闭源商用,无传染性。 MySQL 社区版采用 GPLv2 协议,具有传染性,若程序链接 GPL 代码则必须开源;商业使用需向 Oracle 付费。 社区治理:PostgreSQL 由全球开发者社区管理,不受单一公司商业利益左右,形成良性循环;MySQL 因协议问题导致社区分裂,催生了 MariaDB 分叉项目。 定位演变:PostgreSQL 凭借繁荣的插件生态(如向量、图、时序数据库),已超越传统数据库范畴,演变为“数据操作系统”。

博主头像

🎬 开学必备!五款开源免费AI知识类工具,高效提取知识,重塑学习流程

📄 核心观点 推荐五款开源免费的 AI 知识类工具,旨在通过高效提取知识重塑学习流程。 这些工具均可在 GitHub 找到在线地址或安装包,支持基于原代码进行功能 DIY。 强调 Markdown 格式因结构清晰、Token 利用率高,已成为大模型理解文本的首选格式。 🛠️ 关键事实与工具功能 MinerU:开源 PDF 解析工具,可将 PDF、PPT、图片转换为可编辑的 Markdown,精确提取图片、表格及数学公式,支持扫描类 PDF 转换。 NoteGen:基于 Tauri 2.0 开发的开源 AI 笔记软件,安装包仅 20MB,支持 Windows、Mac、iOS 及安卓全平台。 支持通过 API 接入 AI 能力,配置嵌入模型(如 BGE M3)和对话模型(如 DeepSeek V3.1)构建本地知识库。 具备记录、截图(AI 自动添加描述)、变迁(碎片化知识记录)功能,支持通过 Git 同步至 GitHub 进行版本控制与远端备份。 NotebookLM:谷歌推出的 AI 笔记工具,需国外网络环境,支持将音频、视频、PDF 等归纳为学习指南或思维导图,仅支持 YouTube 视频链接。 BillyNote:开源 AI 视频助手,支持国内平台视频链接,自动提取内容并生成结构清晰的 Markdown 笔记及思维导图,需配置 DeepSeek 等模型 API。 PDF Math Translate:开源 PDF 翻译工具,特点是翻译前后布局一致,完整保留公式、图表、目录等结构化信息,提供在线服务。 Kerry Studio:全能开源 AI 客户端,支持本地知识库、联网搜索及 MCP。 通过 OpenRouter 平台聚合 API,可在同一对话窗口一键切换 ChatGPT、Gemini、DeepSeek 等主流大模型。 📝 结论与建议 建议学生党掌握 Git 与 GitHub 基础,利用其版本控制特性管理笔记历史版本,应对文件协同开发或历史版本找回需求。 组合使用上述工具可形成完整工作流:利用 MinerU 解析文档,NoteGen 存储并构建知识库,BillyNote 处理视频内容,PDF Math Translate 辅助阅读,Kerry Studio 调用多模型能力。 所有工具均免费开源,适合用于提升学习效率、整理碎片化知识及构建个人 AI 知识库。

已显示 30 / 43 篇