博主头像

2026 年了,工作室的 AIO 服务器应该会干什么?

外来客 • 2026-08-25 18:30:18

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

🖥️ 硬件架构与核心配置

  • 基础平台:采用明轩 AI MicroStation 工作站准系统,上下分舱设计。下舱安装处理器、内存及 ATX 电源,上舱提供两个多槽 PCIe 显卡位,支持双显卡独立风道互不干扰。
  • 处理器与内存:搭载 BGA 封装的英特尔 U9 275HX 处理器(22 核),配备 4 条内存槽位。通过转接方案实现 96GB 内存容量,主打高带宽需求场景。
  • 存储与显卡:使用两块 4TB M.2 SSD 作为系统盘和模型盘。核心算力来自两张英特尔 Arc Pro B70 显卡,单卡拥有 32GB 显存、608GB/s 显存带宽及 32 个 Xe 内核,支持主流 AI 模型的原生运行。
  • 系统环境:安装 Ubuntu 26.04 系统,内核版本 7.0,原生支持 B70 显卡驱动,无需额外编译即可识别双卡节点。

🧠 软件部署与模型策略

  • 远程管理:通过 SSH 服务连接 OpenCode 进行远程配置,避免本地重启导致会话丢失。利用 AI Agent 自动执行 Docker 命令、创建共享目录及部署服务。
  • VLM 模型部署:第一张 B70 显卡独占运行千问 3.6 35B A3B 多模态模型。采用 Int4 动态量化权重与 FP8 KV Cache,显存占用约 30.4GB(权重 21.9GB + KV 8.5GB)。
  • 性能指标:单卡最大上下文支持 256K Token,KV Cache 总容量达 850K Token。实测单流速度最高 80 Token/s,并发能力超过 500 Token/s,支持多用户同时调用。
  • 创作引擎:第二张 B70 显卡部署 ComfyUI,使用 HiTouch XPU 后端。支持 MiniMax H3 视频模型、文生图及语音生成,全部在本地生产,零 API 费用。

👁️ 智能感知与安防联动

  • 视觉感知:基于小米开源方案 MiLocal 进行魔改,将云端模型替换为本地 35B 模型,摄像头接入改为通用 RTSP 协议,支持非米家设备。
  • 事件处理:系统通过小模型进行画面变化检测(门控),有变化时调用 35B 模型进行结构化理解。支持人脸识别,区分白名单成员与陌生人。
  • 报警机制:检测到陌生人入侵、烟雾或违规操作(如工作时间玩手机)时,触发语音播报、飞书推送及画面快照留证。
  • 规则引擎:支持自然语言设置规则,无需预训练或逻辑图。例如“有人搬主机则报警”或“检测到烟雾则最高级报警”,由大模型直接判断画面内容。

🛠️ 自动化运维与自我维护

  • 状态监控:通过飞书远程查询服务器状态、VLM 端口及服务运行情况,AI 可自动汇报机器报告。
  • 故障自愈:当 ComfyUI 等服务异常时,AI 可自动确认并重启容器。
  • 定时巡检:创建定时任务每 5 分钟巡检一次,服务崩溃时自动修复并汇报。
  • 成本优势:相比云端 API,本地模型运行无 Token 费用,避免高频调用导致的巨额账单,适合 7x24 小时开机场景。

🎬 内容创作与性能实测

  • 视频生成:MiniMax H3 模型在 B70 上实现 Zero Day 支持。默认工作流下,400MP 分辨率 5 秒视频耗时约 200 秒,720MP 约 600 秒,100 万 NP 约 2300 秒。
  • 效率提升:配合加速插件,流程可再快 2-3 倍。相比 LTX 2.3,H3 在分镜切换、运镜及场景转换的动态可用性上更高。
  • 并发能力:32GB 大显存支持高 KV Cache 和长上下文,确保 MiLocal 感知推理与 OpenClaw 对话并发时不排队,显存资源充足。

⚖️ 局限性与适用建议

  • 识别精度:人脸识别在样本较少时易出错,相似面孔可能误判,导致规则误触发。
  • 事件遗漏:画面变化过大或规则未覆盖时,可能漏报事件,提醒存在遗漏风险。
  • 方案定位:目前处于雏形阶段,适合追求算力本地化、隐私保护及零 API 成本的工作室用户。
  • 核心优势:兼容性好(主流模型原生支持)、显存大(长上下文与并发)、并发稳(多用户同时调用不卡顿)。

博主头像 👤 同一博主

查看该博主全部 51 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。