博主头像

👤 同一博主

按发布时间查看该博主的全部资讯要点

查看全部博主 →
博主头像

🎬 TARMAC:2026年打造AI动画剧集

(原标题:TARMAC - Making an AI-Animated Show in 2026) 🎬 核心观点 《Tarmac》是一部融合职场喜剧与时间旅行元素的AI动画剧集。制作团队坚持“人类主导创意、AI辅助执行”的理念,确保剧本、角色设计及配音均由人类完成,仅在场景构建环节利用AI提升效率与控制力。 🛠️ 关键事实/论据 工作流:主要使用 Blender 3D软件搭建粗糙的环境模型(如家具、墙壁位置),为AI提供精确的空间指引,从而实现高导演控制力的最终画面生成。 工具优化:开发了自定义浏览器插件,支持从Blender拖拽图片至 Magnific 并自动生成提示词;使用 Crumpit 管理复杂提示词以节省时间。 制作现状:第一集已进入生产中期,团队强调保留大量人性化元素(如即兴喜剧创作、现场录音互动)。 📢 结论 项目目前寻求发行支持,旨在展示一种兼顾人类创意灵魂与AI技术效率的新型动画制作模式。

博主头像

🎬 如何制作获奖AI影片:托比亚斯·M·胡贝尔(Tobias M. Huber)访谈

(原标题:How to Make Award-Winning AI Films | Interview with Tobias M. Huber) 🎬 创作背景与动机 职业背景:嘉宾 Tobias M. Huber 拥有传统电影学院背景,曾担任片场导演、制片人,并在德国大型制片公司 Pantaleon Films 工作,参与过 Amazon、Netflix 和 Warner 的项目开发。 行业痛点:传统制片流程中,融资困难、预算限制以及漫长的开发周期严重制约了创作自由,特别是在德国市场,这种“守门人”机制让许多故事难以落地。 AI 的吸引力:AI 技术降低了制作门槛,使得个人或小团队能够以极低成本实现视觉化叙事。Tobias 认为 AI 改变了行业格局,让创作者能更自由地探索创意,不再受限于高昂的制作成本。 📝 叙事方法论:园丁与建筑师 两种写作模式:引用 J.R.R. Martin 的概念,区分“建筑师”(预先规划、适合团队和长周期项目)与“园丁”(随性生长、适合个人创作)两种创作路径。 AI 赋能“园丁”模式:传统电影制作因复杂度高而难以采用“园丁”模式,但 AI 降低了试错成本,允许创作者从一个简单的场景或灵感(如角色飞行的瞬间)开始,逐步扩展出完整的故事背景、角色动机和情节。 灵感来源:Tobias 习惯记录随机想法,并通过测试场景(如动画测试)来验证这些想法是否值得发展成完整作品。 🛠️ 制作流程与技术工具 前期规划:使用 Adobe Boards 或 Miro 制作有机化的镜头列表,将脚本与图像即时关联,便于调整叙事结构。 视频生成工具: Google Veo:用于生成大部分视频序列,能较好地捕捉角色情感。 Kling / Seadream:当 Veo 效果不佳时作为备选方案。 Nano Banana Pro:Tobias 推荐的高效工具,擅长理解风格、角色和场景元素,能显著提升制作效率。 音乐驱动剪辑: 素材来源:从 Artlist 或 Suno 收集音乐,建立长期音乐库。 工作流程:将音乐拖入时间线,利用节奏引导剪辑和叙事走向。 风险提示:避免使用无版权的临时音乐(Temp Music),以免后期因无法获得授权而陷入困境,甚至被迫花费巨资购买版权。 🎓 给新手的建议 模仿学习法:对于不知如何起步的学生,建议选取一部自己喜爱的优秀影片,将其拖入剪辑软件(如 Premiere),逐帧分析其剪辑节奏、镜头运动(如固定镜头时长)和构图细节(如过肩镜头)。 细节观察:通过模仿发现 AI 难以自然生成的细节,例如电影宽画幅中极小的角色比例,这可能需要后期通过 Photoshop 的 Outpainting 功能手动调整,而非单纯依赖提示词。 核心态度:保持好奇心,勇于尝试新工具和新方法,不要因技术限制而放弃创意。 🔮 行业未来展望 成本结构变化:AI 正在降低每分钟内容的制作成本,使得原本因预算过高而无法制作的故事类型得以实现。 商业模式:尽管预算下降,但创作者仍需找到可行的分发和盈利模式。Tobias 希望未来能形成一种商业模式,让创作者能通过讲故事维持生计。 混合制作趋势:未来最优质的内容可能由小团队制作,结合 AI 技术与传统拍摄(如真人出镜)及其他艺术形式,创造出既具观赏性又能吸引付费的内容。 个人规划:Tobias 计划继续利用 AI 讲述对自己和观众都有意义的故事,并期待与小团队合作,探索 AI 与传统技术结合的新可能性。

博主头像

🎬 使用 Stability Matrix 免费安装 ComfyUI 教程(2025)

(原标题:How to Install ComfyUI (Free and Easy) - Stability Matrix Tutorial 2025) 🎯 核心观点 ComfyUI 是基于节点(Node-based)的生成式 AI 工具,相比 Midjourney 等在线工具,其核心优势在于提供对 AI 模型的完全控制。 节点系统允许用户调整采样器设置(如步数)、预览生成过程,并将多个 AI 模型组合成可重复、可分享的工作流。 熟练掌握 ComfyUI 能使用户进入国际 AI 艺术家的小众群体,具备在专业制作中接单的竞争力。 推荐通过 Stability Matrix 安装 ComfyUI,而非直接从官网下载独立版本,以实现多界面共享模型资源及版本管理。 📋 关键事实与论据 节点机制:文本提示节点连接采样器节点,用户可设置步数以生成粗略预览或高质量图像;节点支持组合不同模型以执行特定任务。 安装痛点:直接下载 ComfyUI 会导致单一安装实例,插件更新易导致环境损坏且难以修复;不同 AI 界面(如 WebUI Forge)独立安装会导致模型文件重复占用资源。 Stability Matrix 优势: 开源免费,支持在同一文件夹下管理多个 UI 界面。 允许并行运行不同版本的 ComfyUI,便于项目回滚或升级。 支持“便携模式”(Portable Mode),可整体迁移配置至其他电脑。 内置模型浏览器,直接连接在线资源库下载检查点(Checkpoint)。 硬件要求:教程基于 Windows 系统和 NVIDIA GPU(如 3070 显卡)演示;AMD 显卡需参考其他指南。 模型适配:SDXL 模型训练分辨率为 1024x1024,若使用 512x512 会导致图像异常;教程中使用了 Epic Realism XL 模型。 🛠️ 结论与操作建议 安装步骤: 从 GitHub 下载 Stability Matrix 最新 Windows 版本并解压。 运行程序,选择数据目录并勾选“便携模式”。 在 UI 列表中选择 ComfyUI 进行安装,同时下载所需模型(如 Epic Realism XL)。 在启动选项中勾选“Auto Launch”,以便启动后自动打开浏览器界面。 使用注意: 首次运行工作流时加载时间较长,属正常现象。 根据所选模型调整生成尺寸,SDXL 建议保持 1024x1024。 利用 Stability Matrix 的“Workflow Browser”安装他人构建的工作流,或通过“Checkpoint Manager”管理模型。 遇到问题可参考 Comfy.org 社区、Discord 或咨询 LLM 辅助排查。

博主头像

🎬 使用 ChatGPT 4o 制作书籍封面教程(2025)

(原标题:Create Book Covers with ChatGPT 4o - Tutorial (2025)) 📚 核心观点 自出版书籍失败的主要原因往往不是写作质量,而是封面显得业余。 读者确实会根据封面判断书籍质量,因此需要专业感的封面设计。 作者应专注于故事创作,无需掌握复杂的专业设计工具。 廉价自由职业者效果不佳,顶级设计师预算高昂,AI 是替代“浪费时间”的高效方案。 用户通过 AI 仍能完全控制创作过程,实现个性化设计。 🛠️ 关键步骤与事实 草图准备:在 6x9 英寸画布上绘制草图(可用 iPad 或纸笔拍照),直接添加书名和作者名,确保输出尺寸符合美国标准平装书规格。 素材获取:遵循负责任 AI 使用准则,从 Pexels 和 Unsplash 等网站获取免版税图片作为视觉灵感,避免直接抓取受版权保护的图片。 模型选择:使用 ChatGPT 4.0 模型,该版本具备新图像生成功能,目前仅限 Plus 订阅用户(月费约 20 美元)使用。 提示词构建:上传草图和参考图,提示词需定义小说类型、描述视觉元素、解释草图中的涂鸦含义(如标语),并指定使用附件图片的色彩方案和视觉风格。 进阶技巧(Photobashing): 从网络获取图片,自行调整并拼贴成大致满意的布局。 将此拼贴作品交给 ChatGPT,要求其在保留参考风格的基础上优化细节。 若文字位置不佳或布局混乱,可进一步要求 AI 调整文本位置和整体布局。 尝试将多张真实照片剪裁拼贴,AI 能将其融合为高质量设计。 ⚠️ 结论与注意事项 AI 局限性: 默认倾向于生成插画风格,若要求照片写实风格,人物细节可能出现瑕疵。 字体多样性不足,排版能力有限,这是当前 AI 的弱点。 后期处理建议: 若对排版不满意,可使用 Photoshop 或免费工具 Photopea 进行字体替换和排版调整。 这些软件技能不属于 AI 技能范畴,可通过 YouTube 教程自学。 适用人群:希望低成本、快速获得专业封面,且愿意进行少量手动拼贴或后期调整的自出版作者。 最终效果:结合草图、参考图和 Photobashing 技巧,ChatGPT 能生成远超个人手工速成的高质量封面,甚至能处理复杂的照片合成需求。

博主头像

🎬 AI公司如何误解创造力

(原标题:How AI companies misunderstand creativity) 🎯 核心观点 AI视频生成平台的核心痛点并非生成质量,而是糟糕的用户体验(UX) 当前平台缺乏专业影视制作所需的结构化管理与协作功能 呼吁厂商将产品定位为行业基础设施,而非单纯工具 📋 关键事实与论据 专业团队在数千次生成中遭遇大量重复点击与设置复制粘贴的低效操作 平台存在大量Bug,且缺乏对生成结果的评级、排序及批量下载功能 协作依赖Discord等外部工具,缺乏共享账户或同步设置机制 模型常擅自改变宽高比或拉伸图像,破坏后期制作所需的像素对齐 团队已使用Autodesk Flow in Comfy UI等工具作为临时解决方案 💡 结论与建议 建议增加提示词优化反馈、五星评级系统及批量命名下载功能 需支持团队协作功能,如共享账户与项目设置同步 必须保持原始宽高比,避免图像变形以适配After Effects等后期流程 优化UX是AI视频行业实现专业化跃升的关键前提

博主头像

🎬 用Blender控制AI艺术:Blender与Stable Diffusion ControlNet

(原标题:Control Your AI Art with Blender - Blender & Stable Diffusion ControlNet Tutorial 2024) 🎯 核心观点 传统文本提示词在生成 Stable Diffusion 图像时存在随机性,难以精确控制构图、相机角度及角色姿态。 使用 Blender 构建 3D 场景并渲染深度图(Depth Map),可作为 ControlNet 的输入,从而实现对 AI 生成图像构图的精确控制。 该方法适用于需要高度一致性的场景,如短片制作或同一地点的多镜头拍摄,优于单纯依赖文本提示。 🛠️ 关键事实与步骤 软件准备:需安装 Stable Diffusion UI(推荐 Forge 或 Auto1111)、Blender 以及免费插件 BlenderKit。 Blender 设置: 在偏好设置中开启“Orbit Around Selection”、“Auto Perspective and Depth”。 在着色菜单中启用“Backface Culling”以便查看场景内部。 调整默认立方体为房间模型,尺寸设为 4x5x2 米,并翻转法线(Normals Flip)以显示内部。 场景构建: 利用 BlenderKit 搜索并添加免费资产(如窗户、沙发)。 使用快捷键 `Shift+S`(Selection to Cursor)将物体对齐至墙面或地面。 使用 `R`(旋转)、`G`(移动)、`S`(缩放)调整物体位置,例如将窗户旋转 90 度。 调整相机位置,设置焦距为 24mm、35mm 或 50mm 等常见数值。 深度图渲染: 在渲染层中启用 Z 通道(Z under passes data),关闭阴影,采样数设为 1。 在合成(Compositing)节点中添加“Normalize”节点以标准化深度范围,再添加“Invert”节点反转黑白关系(近处为黑,远处为白),符合 ControlNet 深度图标准。 Stable Diffusion 应用: 在 ControlNet 设置中,将预处理器(Preprocessor)设为“None”,因为输入已是纯深度信息。 输入提示词并生成图像,结果将严格遵循 Blender 场景的构图。 ⚠️ 结论与注意事项 前提条件:用户需具备基本的 Stable Diffusion UI 操作知识,否则建议先学习基础教程。 操作建议: 导航 Blender 视口时建议使用鼠标而非触控板。 渲染深度图时无需高质量设置,仅需黑白深度信息即可。 若渲染结果不佳,需熟悉 Blender 更多功能,可参考额外教程。 适用场景:特别适合需要精确控制构图、消除随机性的创作,如科幻/奇幻场景或系列短片,能显著提升多镜头间的一致性。

博主头像

🎬 Stable Diffusion 中使用 LayerDiffusion 生成带 Alpha 透明通道

(原标题:How to Create PNGs with Alpha Transparency in Stable Diffusion - LayerDiffusion Tutorial 2024) 🎯 核心观点 使用 LayerDiffusion 扩展可在 Stable Diffusion 中直接生成带 Alpha 透明通道的 PNG 图像,无需后期抠图。 该工具能高效处理传统抠图难以解决的细节,如卷曲头发、毛发、玻璃及冰块等半透明物体。 相比手动后期处理,该方法显著节省时间,并实现了此前无法通过常规手段达到的视觉效果。 🛠️ 关键事实与步骤 环境前提:需具备 Stable Diffusion WebUI 基础操作经验;推荐使用 Forge 版本,其速度比 Auto1111 快 75% 且更稳定。 安装流程:从 GitHub 获取 SDForge LayerDiffuse 链接,在 WebUI 的“扩展”中通过 URL 安装,启用后重启界面。 SDXL 模式操作: 选择“Tension Injection”方法(创作者推荐优于其他选项)。 分辨率需至少 1024x1024。 首次生成会自动下载对应模型文件。 生成过程显示灰色背景,最终输出包含透明通道的图像。 SD 1.5 模式操作: 选择“Generate everything together”方法以同时生成前景、背景及合成图。 分辨率需调整为 512x512 等 1.5 标准尺寸。 关键限制:不可使用“高分辨率修复”功能,否则会导致结果损坏。 批次设置:Batch Size 必须设为 3,以同时输出前景、背景和合成图。 提示词优化:需将主提示词移至“前景额外提示词”,并在“背景额外提示词”中指定背景内容,以避免主体在背景中重复出现。 ⚠️ 结论与注意事项 适用场景:适用于需要透明背景的素材生成,特别是毛发、泡沫等复杂边缘细节。 功能局限: 目前不支持 Image-to-Image 模式,无法直接对已有照片进行透明化处理。 无法模拟折射等物理光学效果,仅能近似标准透明度。 SD 1.5 模式下生成的背景质量受提示词影响较大,需精细调整。 性能表现:在 SDXL 模型下,对微小细节(如浪花泡沫)的捕捉能力出色,透明边缘处理精准。

博主头像

🎬 Stable Diffusion XL 最易用的界面:Fooocus

(原标题:The Easiest UI for Stable Diffusion XL – Fooocus) 🎯 核心观点 Fooocus 是 Stable Diffusion XL 的简易用户界面,操作难度低于 Midjourney 无需 Discord 或付费订阅,仅需文本框和生成按钮即可在本地运行 内置风格自动化处理机制,简化提示词编写流程 📊 关键事实 基于 Stable Diffusion XL 模型,分辨率与质量表现突出 安装需约 15GB 空闲空间,自动下载两个 SDXL 检查点 支持速度/质量模式切换、宽高比调整(如 832x1216)及种子值复用 提供负面提示词输入框及多种预设风格(如电影感、复古游戏) 支持加载不同模型及 LoRA 插件 💡 结论 适合 Stable Diffusion 新手快速入门,也便于资深用户高效生成概念图 通过自动化风格处理弥补了传统 SD 提示词繁琐的痛点 可作为演示 Stable Diffusion 或快速创意的轻量级工具

博主头像

🎬 AI将颠覆好莱坞,但并非你想象的那样

(原标题:AI will blow up Hollywood - but not how you think) 🎬 核心观点 主流叙事常将 AI 描绘为剥夺艺术家生计的威胁,但忽视了大量创作者正积极将 AI 整合进创作流程。 AI 并非取代人类,而是赋予个体创作者以低成本实现高成本视觉效果的能力,从而扩大创作可能性。 尽管存在伦理与经济争议,AI 在创意产业中的角色是本质性的,关键在于艺术家如何主导并规范其使用。 📊 关键事实与论据 创作效率提升:两名创作者利用 Stable Diffusion、Runway 及传统工具(After Effects, Blender),制作了通常需数百万成本、时长 90 秒的电影级镜头。 个人工作流变革:作者作为编剧和电影人,过去需耗时制作包含截图、拼贴的提案演示文稿(Pitch Decks);引入 Dolly 2、Mid Journey 和 Stable Diffusion 后,能在几秒内可视化故事场景,从而将更多时间专注于叙事本身。 争议根源分析: 数据授权:Stable Diffusion 等模型训练数据中包含未明确同意的艺术家作品,且用户可通过提示词直接模仿特定艺术家风格,引发版权与尊重问题。 肖像权威胁:好莱坞部分工作室试图以单日薪资永久使用演员的面部和身体形象,构成对艺术家人身权益的威胁。 经济价值稀释:手动创作图像或文本的劳动价值因 AI 的高效性而下降,尽管艺术本身的价值未被贬低,但当前经济体系未对此进行合理补偿。 行业实践规范:Storybook Studios 团队遵循公平原则,不提示真实人物、商标、知名角色或特定导演风格;计划基于参与收益分配的艺术家作品训练微调模型(LoRA),并致力于开发原创风格。 💡 结论 AI 革命的独特性在于“机器”普及且廉价,每个人都能拥有,而非仅由少数巨头掌控。 只要艺术家保持主导权、遵守版权法并设定公平规则,AI 将成为未来创意工作的核心组成部分。 创作者应像皮克斯发明 3D 动画格式一样,利用新工具探索全新风格,而非仅用于模仿旧有形式。

博主头像

🎬 Stable Diffusion - automatic1111 与 ControlNet 安装使用

(原标题:How to Install and Use Stable Diffusion - automatic1111 with ControlNet Tutorial) 🖥️ 系统要求与基础环境配置 硬件前提:Stable Diffusion 最佳运行环境为 NVIDIA 20 系列及以上 GPU,操作系统以 Windows 为例。 软件依赖:必须安装 Python 3.10.6 版本(新版 Python 存在兼容性问题),安装时需勾选“Add Python to Path”;需安装 Git 用于获取 UI 代码及后续更新。 安装步骤: 在命令提示符中进入目标安装目录。 执行 `git clone` 命令从 GitHub 仓库下载 Stable Diffusion Web UI 代码。 运行 `webui-user.bat` 文件,等待自动安装剩余组件。 安装完成后,通过浏览器访问本地地址即可看到用户界面。 🎨 模型选择与基础生成设置 模型来源:推荐从 Civitai 网站下载用户创建的自定义模型,以替代基础模型,从而提升画质或特定风格(如写实、动漫)。 模型部署: 主模型文件需放入 `models/stable-diffusion` 文件夹。 若模型需要 VAE 文件,需单独下载并放入 `models/VAE` 文件夹。 在 UI 设置中搜索 `SD_VAE` 并启用,以便在界面中选择对应的 VAE。 提示词策略: 正向提示词:描述媒介(如“照片肖像”)、主体(如“穿奇幻盔甲的男人”)及细节(如“40岁、棕色头发”)。 负向提示词:描述不想要的内容,特别是质量缺陷或风格冲突(如“卡通、单色”),对控制结果风格至关重要。 核心参数: 采样器:推荐 DPM++ 2M Karras,兼顾质量与速度。 采样步数:20 步用于快速测试,50 步左右为质量与时间的平衡点,过高步数收益递减。 分辨率:建议保持模型训练时的原生分辨率(如 512x512 或 768x768),非正方形比例可能导致多头等异常。 CFG Scale:控制 AI 对提示词的遵循程度。低值(约 3)创意性强但细节缺失;高值(如 15)细节多但可能审美不佳。 批量设置:Batch Size 为单次生成数量,Batch Count 为连续生成次数。 🕸️ ControlNet 扩展应用 功能定位:ControlNet 是 Stable Diffusion 的核心优势,能精确控制构图、姿态和边缘,优于 MidJourney 等竞品。 安装流程:在扩展仓库中搜索 ControlNet 并安装,重启 UI 后,下载对应的模型文件(如 depth、canny、openpose)放入 `extensions/ControlNet/models` 文件夹。 具体模式: Depth(深度):识别参考图的 3D 空间结构(近白远黑),用于保持场景构图一致,但不保留颜色。 Canny(边缘):识别参考图的轮廓线条,用于保留物体形状和位置细节(如窗户、门的位置)。 OpenPose(姿态):识别人物姿态和面部表情,用于生成特定动作的人物图像。 注意事项:ControlNet 主要控制结构,不直接复制颜色信息;首次使用某些预处理器时需下载额外文件。 🛠️ 图像细化与局部重绘 图生图(Img2Img): 用于在保留原图大致色彩和构图的基础上生成变体。 去噪强度(Denoising Strength):关键参数。低值(如 0.2)变化微小;高值变化大但可能偏离原图。 局部重绘(Inpainting): 模型选择:需下载专门用于 Inpainting 的模型版本(如 Cyber Realistic 的 inpainting 版)。 操作逻辑: 使用画笔涂抹需要修改的区域。 Masked Content:设为 "fill" 用于移除物体(如手表);设为 "original" 用于保留原图细节并优化(如修复面部)。 Inpaint Area:设为 "only masked" 可在全分辨率下仅处理遮罩区域,适合细节修复。 提示词:负向提示词用于排除不想要的元素(如“watch”);正向提示词用于描述期望的细节(如“微笑的黑人男性,面部细节丰富”)。 偏见提示:AI 模型存在训练数据偏见,例如默认生成白人男性,需在提示词中明确指定种族特征(如“black man”)以获得预期结果。

博主头像

🎬 使用 Stable Diffusion 和 Blender 为 Quest 制作 360 VR 环境

(原标题:How to Make 360 VR Environments for Quest with AI - Stable Diffusion and Blender Tutorial 2023) 🎯 核心概述 利用 Stable Diffusion 生成 360 度全景图,结合深度图在 Blender 中构建具备真实 3D 深度的 VR 环境,单次创建耗时约 5 分钟,可快速生成沉浸式场景。 ⚙️ 生成流程与参数配置 前置条件需 Windows PC 及 NVIDIA GPU,安装 Auto1111 WebUI。 必须安装 Asymmetric Tiling、Panorama Viewer 及 Depth Map Script 扩展。 使用 360 Diffusion LoRA,触发词 QXJ,权重 0.3;基础模型推荐 Aeonimix V6。 分辨率保持 2:1 比例(如 1024x512),采样器选用 DPM++ 2M Karras,步数 50,开启 X 轴不对称平铺。 后处理使用 ResNet101 生成深度图,RealESRGAN 4x 放大,Inpainting 修复瑕疵(去噪强度 0.45)。 🛠️ Blender 建模与导出 手动法创建 256 细分网格,应用 Emission 材质,通过 Warp 变形形成球体,翻转法线并开启背面剔除。 添加 Displace 修改器,加载深度图,强度 0.5,坐标设为 UV。 调整比例匹配人体高度,导出为 GLTF 2.0 格式。 导出时设置格式为 GLTF separate,仅包含选中对象,勾选 Apply Modifiers 确保实体状态。 📱 部署与体验验证 为环境包命名(如 Victorian Mansion),确保 Meta Quest 连接并开启开发者模式。 点击 Build and Install Environment 执行安装,安装成功后作为 Quest 默认背景。 用户可在该 3D 环境中正常访问菜单、选择应用,场景具备真实空间感,门与家具存在明确前后距离差异。 尽管视频展示为 2D,实际体验为完全三维立体空间。 💡 结论与建议 适合制作 Quest 等 VR 设备的自定义家庭环境或游戏场景,相比传统 3D 建模更简单。 局限性包括天花板和地板无法上下无缝连接、房间形状可能非标准矩形、存在视角畸变风险。 当前主要缺点是画质相对较低,预计未来技术改进将显著提升质量。 作者开发了免费 Blender 插件 Environ Make,可自动化球体生成与深度贴图应用,简化手动操作步骤。 建议加入 Quest Homes Discord 获取最新教程,下载 Quest Custom Home Environment 启动文件及环境转换器。

博主头像

🎬 使用 Stable Diffusion 制作无缝纹理的 AI 教程

(原标题:OUTDATED | How to Make Seamless Textures with AI - Stable Diffusion Tutorial 2023) 🎨 核心观点与工具对比 视频展示了两种利用 AI 生成 PBR(基于物理的渲染)材质的方法:本地 Stable Diffusion 结合 Materialize 工具,以及在线服务 Poly。 本地方法完全免费,但流程较复杂,需要手动配置模型和参数。 Poly 服务提供在线生成和社区素材库,操作更简便,且能直接生成全套 PBR 贴图(颜色、法线、高度、环境光遮蔽、粗糙度)。 两种方法均可生成无缝纹理,适用于 3D 建模和渲染。 🛠️ 本地方法:前提与准备 必要软件:Auto 1111 Stable Diffusion UI(或任何支持 Stable Diffusion 的界面)。 核心模型:Texture Diffusion 模型,可在 Civitai 下载。该模型基于 CC0 纹理训练,生成的漫反射贴图平坦、无阴影,适合后续处理。 辅助工具:Materialize,一个基于 Unity 开发的免费 Windows 工具,用于从漫反射贴图生成高度图、法线图等。 基础要求:用户需熟悉 Stable Diffusion 的基本操作,无需特殊扩展插件。 📝 本地方法:生成步骤与参数 提示词策略: 正向提示词以 "PBR" 开头作为触发词,随后描述具体材质(如 "dirt and moss with pebbles")。 添加描述词如 "close up"、"detailed"、"photo real"、"high detail" 以提升细节。 负向提示词排除 "cartoon"、"illustration"、"3d render"、"sketch"、"black and white" 等风格。 采样设置: 采样器:DPM++ 2M Karras。 采样步数:50 步。 批量数量:4 张。 分辨率:512x512。 CFG Scale:7。 关键设置:必须开启 "Tiling"(平铺)选项以确保纹理无缝。 放大处理: 使用 Image-to-Image 功能,将分辨率提升至 1024x1024。 去噪强度(Denoising Strength)设为 0.2,以保留原图细节并增加清晰度。 再次确保开启 "Tiling" 选项。 📊 本地方法:Materialize 贴图生成 高度图(Height Map): 导入漫反射贴图后,点击 "Create" 生成高度图。 使用 "Details" 预设获得清晰细节,可调整对比度。 若效果过强,可切换至 "Displacement" 预设以柔化效果。 法线图(Normal Map): 基于高度图即时生成,可调整对比度以控制细节强度。 光滑度/粗糙度(Smoothness/Roughness): Materialize 生成的是光滑度图(Smoothness),与粗糙度图(Roughness)互为反色。 调整基础光滑度值,避免材质看起来过于湿润或完全哑光,增加局部对比度以模拟露珠等细节。 环境光遮蔽(Ambient Occlusion): 模拟光照阴影,增强立体感。 可调整 "Power" 参数控制阴影强度。 输出:保存项目后,文件夹中将包含所有 PBR 贴图及 Materialize 工程文件。 🌐 在线方法:Poly 服务流程 平台功能: 提供 AI 生成 PBR 材质功能,支持最高 2K 分辨率(免费层),付费层支持 8K。 拥有庞大的社区素材库,可浏览和下载他人创建的材质。 生成步骤: 输入提示词(如 "dirt and moss with pebbles, close up, detailed, photo real")。 选择材质类型(如 "Organic")和分辨率。 点击生成,系统自动创建颜色图、法线图、高度图、环境光遮蔽图和粗糙度图。 后处理: 若需更换生成的颜色图,需手动重新生成其他 PBR 贴图。 可使用 "Make Seamless" 功能快速生成无缝纹理。 支持实时预览,可调整环境光(如 "Sunset")、位移高度和贴图可见性。 ⚖️ 结果对比与结论 本地方法: 优点:完全免费,无网络依赖,可深度定制。 缺点:流程繁琐,需手动调整多个参数,最终效果受限于本地模型和工具。 Poly 方法: 优点:操作简便,一键生成全套贴图,社区资源丰富,预览效果直观。 缺点:依赖网络,高分辨率和商业使用需付费(Poly Infinity)。 最终评价: Poly 生成的材质在细节和真实感上优于本地方法,尤其是单个石子和苔藓的清晰度。 本地方法适合希望完全控制流程且预算有限的用户。 两种方法均能产出可用的 PBR 材质,选择取决于用户对便捷性和控制权的偏好。

博主头像

🎬 使用 Stable Diffusion 和 ControlNet 进行 AI 照片上色教程

(原标题:How to Colorize Photos with AI - Stable Diffusion + ControlNet Tutorial 2023) 🛠️ 环境配置与模型准备 基础要求:需安装 NVIDIA 显卡的 Windows 电脑,并预先安装 Stable Diffusion Web UI(Automatic1111)。 模型下载:从 Civitai 下载 Realistic Vision 2.0 模型文件(.safetensors),放置于 `models/Stable-diffusion` 文件夹。 VAE 设置:下载对应的 VAE 文件放入 `models/VAE` 文件夹;在 UI 设置中启用 `sd_vae` 选项并指定该文件,以优化图像质量。 ControlNet 扩展:通过 URL 安装 `sd-webui-controlnet` 扩展,并在设置中将 `multi-controlnet max models` 数量设为 3,以便同时使用三个控制模型。 📸 图像预处理流程 裁剪与尺寸:使用 Affinity Photo 或 Photoshop 裁剪出人物肖像,推荐初始尺寸为 512x768 像素,以便后续处理。 去噪与清理:使用克隆工具移除照片上的斑点、划痕等瑕疵,避免干扰 Canny 边缘检测算法;应用去噪滤镜平滑图像,去除噪点。 色彩调整:移除所有饱和度(转为黑白),并通过曲线调整增加少量对比度,恢复因年代久远丢失的阴影细节。 导出准备:将处理后的图像导出为 PNG 格式,文件名标记为 "1",尺寸保持 512x768 以适配 ControlNet 输入。 ⚙️ Stable Diffusion 生成设置 ControlNet 配置: 模型 0:启用 Depth 预处理器和模型,用于识别深度轮廓。 模型 1:启用 Canny 预处理器和模型,阈值建议设为低 30、高 130(或根据效果调整为 40-70),以提取清晰边缘。 模型 2:启用 OpenPose 预处理器和模型,锁定人物姿态和朝向。 采样参数:采样方法选择 DPM++ 2M Karras,步数设为 30,批量数量设为 4,高度设为 768。 提示词构建: 正向提示:利用 Image-to-Image 的 Interrogate CLIP 功能生成基础描述(如“穿制服、有胡须的男人”);结合历史知识添加具体细节(如“深蓝色制服”、“金色纽扣”);加入权重词 `raw photo:1.5`、`healthy skin`、`high detail`、`studio lighting`。 负向提示:包含 `black and white`、`ugly colors`、`zombie`、`cartoon` 等,以确保色彩真实且人物健康。 🎨 后期合成与精修 色彩融合:将生成的彩色图像导入编辑软件,混合模式设为“颜色”(Color),叠加在原始黑白照片上,保留原图的纹理和细节。 面部修正:使用液化(Liquify)工具微调五官位置,使其与原照片更贴合;通过曲线调整肤色,去除过红或不自然的色调。 放大与重绘: 使用 Extras 功能将图像放大 2 倍(使用 R-ESRGAN 4x+ 模型)。 进入 Inpaint 模式,仅对面部区域进行重绘,设置 Inpaint area 为 "Only masked",分辨率设为 512x512,以修复面部细节并消除生成瑕疵。 最终调整:对比原图与生成图,手动微调眼睛、鼻子等关键特征,确保神态一致;最终导出全分辨率图像。 💡 核心结论与建议 AI 辅助定位:AI 是照片上色和修复的极佳起点,能大幅加速流程,但无法完全替代人工。 人工介入必要性:对于历史准确性(如制服颜色、面部特征)和最终细节(如眼神、皮肤质感),仍需大量手动修图和历史研究。 适用场景:该方法适用于专业修复师或爱好者,特别适合处理 Civil War 等历史人物照片,能生成高质量、逼真的彩色图像。

博主头像

🎬 使用 AI 制作等距游戏资产:ControlNet、Stable Diffusion 与 Blend

(原标题:How to Make Isometric Game Assets with AI - ControlNet, Stable Diffusion + Blender Tutorial 2023) 🎯 核心观点 仅通过文本提示词生成等距(Isometric)游戏资产会导致视角不一致,无法直接用于游戏开发。 结合 Blender 创建粗略 3D 模型并渲染深度图(Depth Map),再输入 ControlNet 进行引导,是生成视角统一、风格可控的等距资产的有效方法。 该方法不仅适用于城市模拟或 RPG 风格,也可用于奇幻风格或室内场景,具有极高的灵活性和复用性。 🛠️ 环境准备与工具配置 软件需求:需安装 Stable Diffusion(使用 Auto1111 界面)及 Blender。 插件安装:在 Auto1111 扩展中通过 URL 安装 ControlNet 扩展,并在设置中启用。 模型下载: 下载 ControlNet 深度模型(`control_depth`)及对应的 YAML 文件,放入 `extensions/SDWebUI ControlNet/models` 目录。 下载 Aeonimix 模型(版本 5)放入 `models/Stable-diffusion` 目录。 下载 VAE 模型放入 `models/VAE` 目录,并在设置中将 `SD_VAE` 添加到快速设置列表。 Blender 设置: 将相机类型改为正交(Orthographic)以消除透视畸变。 调整相机角度至 30-45 度之间,符合等距游戏标准。 将渲染分辨率设置为 2048x2048,以便后续裁剪时保留足够细节。 🏗️ Blender 建模与深度图渲染 网格创建: 删除默认立方体,添加平面(Plane)并缩放 8 倍以覆盖画面。 添加细分表面(Subdivision Surface)修改器,数量设为 4,类型设为 Simple。 添加线框(Wireframe)修改器,降低厚度以显示网格线,并禁用渲染以仅作为视觉参考。 粗略建模: 创建基础立方体并调整位置,使用循环切割(Loop Cut)等基础操作构建建筑大致轮廓(如别墅、医院或工厂)。 无需关注材质、灯光或精细拓扑,仅需确保形状符合预期。 深度图合成: 在合成(Compositing)标签页启用节点。 在图层属性中勾选 Z 通道(Z in Data)以输出深度信息。 添加 Normalize 节点处理深度数据,使最近点为纯白,最远点为纯黑。 添加 Invert 节点反转颜色,因为 Stable Diffusion 使用相反的颜色逻辑(黑为近,白为远)。 将最终颜色输出连接至图像节点,渲染并保存为 PNG 格式的深度图。 🎨 Stable Diffusion 生成流程 ControlNet 设置: 在 ControlNet 标签页上传生成的深度图。 选择 `control_depth` 模型,无需预处理器(Preprocessor)。 将权重(Weight)调整为 0.6,以保留 AI 生成细节的空间,同时维持视角一致性。 提示词策略: 正向提示词描述风格(如 3D 渲染、Flash 游戏风格)及具体建筑特征(如红色瓦顶、托斯卡纳风格、现代建筑、车库等)。 负向提示词排除不需要的元素。 生成参数: 采样方法:Euler A。 采样步数:20 步用于初步风格探索。 批量数量:4。 高分辨率细化技巧: 将初步结果发送至“图生图”(Image to Image)模式。 将分辨率提升至 1024x1024 或更高。 降低重绘幅度(Denoising Strength)至 0.2 左右,以保留原有构图和风格。 增加采样步数至 45 步,并复制相同的种子(Seed)和 ControlNet 设置,以生成更清晰、细节更丰富的最终图像。 ✂️ 后期处理与资产裁剪 自动蒙版技术: 在图像编辑软件(如 Affinity Photo、Photoshop 或 GIMP)中,将生成的图像与原始深度图叠加。 对深度图图层应用阈值(Threshold)滤镜,将灰度渐变转换为黑白二值图像,从而获得建筑轮廓蒙版。 将该蒙版应用到图像图层,即可快速去除背景,获得干净的透明背景资产。 多风格复用: 使用同一张深度图,仅修改提示词(如从“家庭住宅”改为“医院”或“工厂”),即可生成不同功能但视角完全一致的建筑资产。 此方法确保了所有资产在网格上的对齐和透视统一,极大提高了游戏资产制作的效率。

博主头像

🎬 如何在AI艺术中使用ControlNet——Stable Diffusion 2023教程

(原标题:How to use ControlNet in your AI Art - Stable Diffusion Tutorial 2023) 🛠️ 前置准备与模型配置 基础要求:需具备 Stable Diffusion 基础及 Auto1111 Web UI 使用经验。 核心组件: Checkpoint:推荐 Aeonimix 模型,开箱即用效果更佳。 VAE:必须安装以优化图像质量,尤其是配合特定模型时。 ControlNet 扩展:通过 GitHub 链接在扩展标签页安装,安装后需在“已安装”标签页激活并重启 UI。 多模型支持:在设置中启用 Multi ControlNet,建议设置为 2 或更多,以便叠加使用不同控制模型。 控制模型下载: Canny:基于 Canny 边缘检测算法,用于提取图像边缘结构。 OpenPose:用于识别人物姿态并转换为骨架图。 安装路径:将下载的 `.safetensors` 文件放入 `extensions/sd-webui-controlnet/models` 文件夹,重载 UI 后即可在预处理器和模型列表中选择。 🎨 构图草图与预处理 草图制作: 工具:使用 Affinity Photo(一次性付费,非订阅制)。 尺寸设定:创建 3072x2048 像素画布。依据是 Stable Diffusion 训练数据为 512x512,3072 是 512 的 6 倍,2048 是 512 的 4 倍,保持长宽比一致。 内容构成:快速拼贴参考图(如 NASA 控制室、故障机器、触手、人物),无需精细编辑颜色和细节,重点在于构图、线条和大致轮廓。 人物参考:拍摄自己不同姿态的照片(如逃跑、握拳),穿着有明显轮廓特征的衣服(如带深色纽扣的衬衫),避免手部细节过多导致 AI 生成错误。 导出:保存为全分辨率 JPEG,命名为迭代版本(如 1)。 ⚙️ ControlNet 参数设置与生成 基础设置: 标签页:Text to Image。 采样器:DDIM,步数 20,批量 4。 分辨率:768x512(与草图长宽比一致)。 ControlNet 配置: 模型 0 (Canny): 预处理器:Canny。 模型:Canny。 权重:初始 1.0,若构图过于僵硬可降至 0.5 以增加自由度。 画布尺寸:768x512。 模型 1 (OpenPose): 预处理器:OpenPose。 模型:OpenPose。 权重:初始 1.0,若姿态过于受限可降至 0.5。 画布尺寸:768x512。 提示词策略: 描述场景核心元素(如 NASA 实验室、传送门、触手、穿西装逃跑的科学家)。 若特定元素(如触手)未生成,需在提示词中增加权重或强调描述。 迭代调整: 观察生成结果,若构图太死板,降低 Canny 权重;若姿态不准,调整 OpenPose 权重。 结合 Inpainting 修复局部细节(如面部表情、咖啡杯)。 🖌️ 局部重绘与细节优化 放大处理: 使用 Extras 标签页,选择 ESRGAN 4x 上采样器,将图像放大 4 倍,为后续高清重绘做准备。 Inpainting 流程: 标签页:Image to Image。 ControlNet:仅启用 OpenPose(若需控制人物姿态),禁用 Canny(构图已定)。 遮罩区域:仅遮罩需要修改的区域(如人物面部、怪物细节)。 关键设置: Inpaint Area:必须选择 "Only masked",确保仅重绘遮罩区域,保留其他部分的高清细节。 Denoising Strength:约 0.65,平衡变化与保留。 分辨率:根据遮罩区域长宽比调整(如垂直区域设为 512x768)。 提示词:具体描述重绘内容(如“惊恐的男人、蓝色西装、拿着咖啡杯”)。 细节修复: 针对 AI 生成瑕疵(如手部、面部表情),多次迭代 Inpainting。 利用备份图层在 Affinity Photo 中手动清理残留伪影。 逐步添加特效(如爆炸、火焰、玻璃碎片)以增强场景氛围。 📌 核心结论与注意事项 ControlNet 优势:相比传统 Image-to-Image,ControlNet 不依赖颜色信息,更专注于结构和姿态,允许用户更精确地控制构图和人物动作,同时保留 AI 的创意发挥空间。 工作流建议: 快速制作低精度构图草图。 使用 Canny + OpenPose 双模型生成基础构图。 调整权重平衡“控制”与“创意”。 放大图像后,使用 Inpainting 逐区域细化细节。 后期软件手动清理伪影并合成最终作品。 关键技巧: 人物参考图需避免复杂手部动作,穿着轮廓清晰的衣物。 Inpainting 时务必设置 "Only masked" 并匹配遮罩区域分辨率,防止细节丢失。 提示词需具体且包含关键元素权重,以引导 AI 生成预期内容。

博主头像

🎬 使用 Stable Diffusion 制作史诗级电影与游戏标题的教程

(原标题:OUTDATED | How to Make Epic Movie and Game Titles with AI - Stable Diffusion Tutorial 2023) 🎯 核心观点 利用 Stable Diffusion 的 Depth-to-Image 技术,通过伪造深度图(白字黑底)可快速生成具有 3D 质感的电影或游戏标题。 该方法突破了传统 AI 难以处理文本的局限,能在数秒内生成原本需要手工绘制或 3D 建模的复杂标题效果。 此技术适用于快速原型设计、Logo 构思及独立游戏开发,能大幅降低制作门槛和时间成本。 🛠️ 关键步骤与事实 环境准备:需安装 Auto1111 Web UI 及 Stable Diffusion,并下载 `512-depth-ema.ckpt` 模型文件。 配置要求:模型文件需与同名的 `.yaml` 配置文件一同放入模型文件夹,且文件名必须完全一致。 插件安装:在 Web UI 扩展中安装 `DepthImageIO`,以启用自定义深度图上传功能。 素材制作:在图像编辑软件中创建 768x512 像素画布,背景填黑,使用白色粗体字输入标题文本。 参数设置:采样方法设为 DDIM,步数 20,宽度调整为 768 以匹配源图,批量生成 4 张。 提示词策略:正向提示词包含“top down view”、“seamless”、“epic”、“cinematic”等;负向提示词排除“cartoon”、“low resolution”、“black and white”等。 风格定制:科幻风格可添加“dirty, rusty, metal, blue and red lights”;奇幻风格可添加“shiny fantasy metal texture”、“chrome”。 ⚠️ 结论与注意事项 精度限制:深度图分辨率较低,细小细节容易丢失或变形,复杂符号可能失真。 后期处理:生成结果需手动抠图,可利用原始文本作为蒙版辅助,但仍需人工修整边缘。 字体建议:应使用笔画较粗、线条简单的字体,避免过多细节导致生成失败。 适用场景:适合用于快速展示概念、制作原型或生成大量备选方案,而非直接用于最终高精度成品。 效率优势:相比传统 3D 建模或手绘,该方法能在几分钟内生成数十种不同风格的选项,极大提升创意迭代速度。

博主头像

🎬 使用 Dream Textures AI 为 3D 资产添加纹理:Stable Diffusion

(原标题:OUTDATED | How to Texture 3D Assets with Dream Textures AI - Stable Diffusion Blender Tutorial 2023) 📝 一句话概述 该视频演示了利用 Blender 结合 Stable Diffusion 技术,通过深度图投影映射高效生成游戏级 3D 纹理的完整工作流,涵盖从基础建模、AI 纹理生成到最终烘焙整合的全过程,旨在降低原型制作门槛并提升资产迭代效率。 🛠️ 核心观点 结合 Blender 基础建模与 Stable Diffusion 技术,可高效生成接近游戏资产标准的 3D 纹理,显著缩短手工绘制时间。 该流程并非完全自动化,需用户具备 Blender 操作及 Stable Diffusion 参数调整能力,否则易产生挫败感。 通过深度图投影映射技术,AI 能理解场景形状并应用纹理,支持基于单一模型快速生成多种风格变体。 烘焙后的材质具有高度实用性,不仅适用于 Blender 内部,也方便在外部软件中使用,有助于摆脱对在线模型库的依赖。 📋 关键事实与步骤 环境要求:需安装 Blender 3.4 及 Dream Textures 插件,下载约 4GB 模型文件;支持 NVIDIA GPU。 基础流程: 建模后按 N 键打开 Dream 标签页,选择模型(如 Stable Diffusion 2 Depth)。 输入提示词(如“video game style, wood”)及负面提示词(如“photo, realistic”)。 视口调整为正方形,增加焦距使物体充满画面,切换至材质预览模式。 点击“Project Dream Texture”生成纹理,随后在 UV 编辑器中手动修正边缘错位。 进阶技巧: 深度与颜色输入:在纹理绘制模式下预画草图(如船体木板、炮口),结合深度信息引导 AI 生成特定细节。 局部投影:仅选中特定顶点(如甲板、船帆)进行投影,避免重叠干扰;船帆需单独制作后阵列复制。 备份机制:投影前必须备份 UV 地图,因插件会覆盖原有 UV 数据且无法通过撤销恢复。 最终烘焙: 创建新材质“Baked Material”及新 UV 地图(Smart UV Project,岛边距 0.01)。 创建 2048x2048 的“Baked Diffuse”图像节点,并复制至所有源材质中。 渲染引擎切换为 Cycles,烘焙类型设为 Diffuse,仅勾选 Color 贡献。 执行烘焙后,应用新材质并删除旧材质,实现单纹理资产整合。 ⚠️ 结论与注意事项 局限性:生成结果非完美,背面及复杂角落需手动 UV 调整或克隆印章工具修复;AI 可能添加不需要的细节(如多余牙齿、错误光影)。 数据风险:生成的纹理不会自动保存,必须手动执行“Image > Save”,否则数据丢失;插件更新频繁,遇到问题需查阅 GitHub 讨论区。 适用场景:适合快速原型制作及低多边形风格游戏资产,不适合高精度写实渲染;可用于视频背景资产制作、构建原创城市场景或导入现有物体重新纹理化。 性能优化:建议开启半精度以提升速度,但可能导致轻微 UV 偏差,需后期修正。 持续维护:插件功能持续更新,GitHub 上有定期维护和新功能发布,建议用户定期查看仓库以获取最新功能。

博主头像

🎬 我用 ChatGPT 和 Stable Diffusion 制作了一款完整的视频游戏!——AI 助力

(原标题:How I used ChatGPT and Stable Diffusion to make a whole video game! - AI for Godot Game Dev) 🎮 一句话概述 本视频展示了利用 ChatGPT、PseudoWrite 和 Stable Diffusion 辅助开发 Godot 引擎点击式冒险游戏的全过程,验证了 AI 在叙事构建与美术生成上的高效性,同时揭示了其在 GDScript 代码生成方面的局限性,最终产出了一款可玩的 Web 游戏原型。 🛠️ 技术栈与开发环境 选用 Godot 3.5 引擎作为开发基础,主要考虑到 ChatGPT 的知识截止日期为 2021 年,以避免使用当时尚未稳定或数据较少的 Beta 版 4.0 引擎 采用 OpenGL 2.0 渲染器以确保兼容性与稳定性 开发目标为制作一款基于 Web 的点击式冒险游戏,旨在降低非专业程序员的入门门槛 整体技术路线强调利用现有 AI 工具弥补个人在编码经验上的不足,实现从策划到原型的全流程覆盖 📝 叙事构建与剧情设计 使用 PseudoWrite 工具生成核心故事大纲,主题设定为“沉没潜艇”,背景为二战期间因武器测试被未知生物拖入深海 玩家核心任务包括寻找信号弹、鱼叉枪等关键物品,用于驱赶深海生物并修复潜艇以达成结局 AI 生成的故事线逻辑自洽,仅需少量人工调整即可完善,显著提升了内容质量与创作效率 在剧情推进遇到卡点时,通过 AI 提示解决具体逻辑问题,例如将食物装入鱼雷管发射以摆脱鱿鱼,从而顺利实现剧情转折与结局达成 叙事环节体现了 AI 在创意构思、场景描述及道具设定方面的优势,大幅减少了人工构思的时间成本 🎨 美术资源生成与优化 结合 Stable Diffusion 1.5 与 Midjourney V4 模型生成游戏场景图,利用 AI 捕捉核心视觉元素 针对文字描述直接生成图像效果不佳的问题,采用 Image-to-Image 技术对初始图像进行调整,重点优化光照效果和细节表现 尽管 AI 能生成符合主题的画面,但在物体位置、光照一致性等细节上仍存在偏差,需后期使用 Affinity Photo 等专业软件进行精修 美术制作流程验证了 AI 在视觉资源生成上的可行性,但强调了人工后期处理在提升最终视觉质量中的必要性 整体美术风格服务于点击式冒险游戏的氛围营造,确保场景图与叙事主题高度契合 💻 代码生成与逻辑实现 ChatGPT 成功生成了基础的 GDScript 代码,涵盖变量定义、数组管理及输入处理等核心功能 然而,AI 对 GDScript 语言的理解存在局限,可能将其误认为其他编程语言,导致生成的代码结构混乱或不符合引擎规范 初始生成的代码仅支持控制台打印输出,缺乏动态界面交互,需开发者手动重构以支持鼠标悬停显示描述、点击切换场景及物品拾取等交互逻辑 利用 Godot 的信号机制实现交互功能,并通过 CSV 文件集中管理房间数据,以优化代码结构与数据维护 开发者花费约两天时间完成游戏,认为该时长过长,表明 AI 在编码环节并未提供实质性的高效帮助,主要依赖人工完成逻辑构建与调试 代码生成环节暴露了当前 AI 在小众引擎脚本编写上的能力短板,要求开发者具备较强的编程基础以进行代码重构与优化 ⚖️ 结论与适用场景分析 AI 工具显著降低了游戏开发的门槛,特别是在叙事构思、场景描述及美术资源生成方面表现优异,形成了“AI 负责创意与视觉,人类负责逻辑与结构”的分工模式 在 GDScript 编码环节,AI 的辅助效果有限,输出结果具有不可预测性,需多次迭代和人工修正,且存在将语言混淆的风险 最终产出的 Web 游戏原型证明,AI 辅助开发在特定类型(如点击式冒险)游戏中具备实用价值,但无法完全替代人类开发者的逻辑思维能力 建议用户根据项目需求合理分配 AI 与人工的工作比重,若擅长编程可尝试优化 AI 生成的代码质量,若侧重创意则可充分利用 AI 在叙事与美术上的优势 对于希望深入图像生成技术的用户,建议参考相关教程以提升 Stable Diffusion 的使用效率,同时关注 AI 工具在特定垂直领域的应用案例

博主头像

🎬 用 AI 设计 B 级电影:与 @walljumpcreations 合作打造 VRChat 便利店

(原标题:I designed a B-Movie with AI | Collab with @walljumpcreations for the VR Chat Inconvenience Store) 🎬 项目背景与目标 视频展示了利用 AI 工具为 VRChat 中的“Inconvenience Store”(不便商店)设计一款 B 级电影(B-Movie)DVD 封面的过程。 该商店由 WallJumpGaming 创建,主打 AI 生成的怪异商品(如牙齿麦片、脚趾甲薯片)。 核心目标是制作一个完全由 AI 生成纹理、最终转为 3D 模型的廉价 DVD 包装,模拟超市“特价区”(Bargain Bin)中那些模仿知名电影(如《料理鼠王》、《狮子王》)的劣质盗版碟。 最终成品是一个可在 VRChat 中查看的 3D DVD 盒,包含正面、背面和侧面的完整设计。 🛠️ 工具链与工作流程 文本生成:主要使用 GPT-3 生成剧情简介、角色名字、反派设定及影评。辅助使用 PseudoWrite 生成荒诞的情节转折点(如“巫师把水换成了酷爱饮料”、“太空巨型蚂蚁”)。 图像生成: Stable Diffusion:用于生成电影海报底图、角色概念图及背面截图。提示词包含“90s CGI”、“anthropomorphic eggplant”(拟人化茄子)、“Veggie Tales style”等关键词,以营造复古且略带诡异的视觉效果。 DALL-E 2:用于生成特定风格的蔬菜角色(茄子、香蕉、木瓜),因其更擅长处理这种特定的 90 年代 CGI 质感。 后期合成:使用 Photoshop 进行图层合并、内容感知填充(Content-Aware Fill)、液化滤镜调整、文字排版及光影融合。 3D 建模:使用 Blender 构建 DVD 盒的基础结构,并将生成的 2D 纹理贴图应用到模型上。 📝 内容创作细节 剧情设定: 主角是一位年轻女性,在盲约中爱上了一位看似普通实则秘密身份为超级英雄“Mental Mercury”(心灵水银)的男子。 反派是“Emperor Mind Reader”(读心皇帝),拥有读心能力。 核心冲突涉及世界危机,具体表现为“太空巨型蚂蚁”入侵。 电影标题定为《I can't believe I'm with a superhero》(不敢相信我和超级英雄在一起)。 视觉风格: 正面封面:明亮、快乐,展示拟人化蔬菜角色(茄子、香蕉、木瓜)的互动,带有性暗示意味(如茄子、香蕉的形状)。 背面封面:黑暗、神秘,展示反派蚂蚁军团及动作场景截图。 侧面:蓝色渐变背景,印有标题。 文本元素: 背面包含剧情简介、演员表(虚构名字如 Amanda Huggenkiss, Ace McNeely)以及来自“Bargain Bin Times”和“New York Times”的虚构好评。 影评强调“茄子”将成为经典,并包含双关语(如“egg-cited”)。 📊 技术难点与解决方案 手部与面部畸变:Stable Diffusion 生成的图像常出现手部结构错误(如多余手指、手臂变头发)或面部扭曲。 解决:通过 Photoshop 手动修复、液化调整,或利用“内容感知填充”移除错误部分。 文字生成困难:AI 难以直接生成清晰可读的标题文字。 解决:在 Blender 中单独建模 3D 文字,或在 Photoshop 中使用 3D 文字编辑器重新排版,确保文字清晰且符合 DVD 包装风格。 风格统一性:不同 AI 工具生成的角色风格不一致。 解决:在 Photoshop 中通过擦除边缘、添加背光效果(Light peeking through)来融合不同来源的角色,使其看起来属于同一场景。 🎯 最终成果与体验 成品是一个完整的 3D DVD 盒模型,所有文本和图像均可在 VRChat 中清晰阅读。 设计意图是制造一种“尴尬”且“廉价”的幽默感,模拟现实中那些质量低劣但包装诱人的盗版电影。 用户无需 VR 头显,仅通过 PC 即可访问 VRChat 中的 Inconvenience Store 查看该作品。 项目体现了 AI 在创意协作中的潜力,同时也暴露了当前 AI 在细节控制(如手部、文字)上的局限性,需依赖传统后期软件进行修正。

博主头像

🎬 一小时AI艺术挑战:“黑暗与光明”对决 @pjgalbraith

(原标题:1 Hour AI Art Challenge - "Darkness vs. Light" against @pjgalbraith) 🎨 挑战规则与核心任务 本次创作挑战的核心目标是在严格的一小时时限内,完成一幅比例为 16:9 的 AI 辅助艺术作品。 作品主题被确定为“黑暗与光明”,该主题是通过 289 名观众的投票最终选定的,旨在通过强烈的视觉对比来传达叙事张力。 技术限制非常具体,仅允许使用 Stable Diffusion 1.4 或 1.5 模型进行图像生成,以及 Runway 1.5 的重绘模型进行视频或图像优化。 后期处理软件的选择保持自由,创作者最终选用了 Photoshop 作为主要的合成与精修工具。 整个创作过程要求全程无休息,计时器精确运行,这极大地压缩了试错与迭代的时间窗口。 创作策略上,作者选择侧重表现“黑暗”元素,仅用少量的“光明”作为点缀,以形成强烈的视觉反差和恐怖氛围。 灵感来源明确指向经典艺术与现代电影,包括 Gustave Doré 的洞穴与天使坠落作品,以及电影《木乃伊》中的石棺元素。 这种策略旨在利用 AI 对特定风格元素的生成能力,结合传统艺术构图,快速构建出具有电影感的恐怖场景。 🛠️ 前期构思与草图阶段 在正式使用 AI 生成之前,创作者使用数位板绘制了粗糙的草图,以确立基本的构图框架。 草图内容主要包括洞穴背景、位于中心的石棺(Sarcophagus)以及一个持铲逃跑的人物形象。 人物姿态参考了 Gustave Doré 的作品,旨在通过肢体语言表现极度的恐惧感和紧迫感。 这一阶段的重点在于确定视觉焦点和叙事逻辑,确保后续 AI 生成时能够围绕核心元素展开。 草图虽然粗糙,但为后续的提示词编写和局部重绘提供了明确的视觉指引,避免了生成方向的偏离。 通过草图,创作者明确了“黑暗”占据主导,“光明”仅作为局部高光或光源存在的视觉层级。 这种前期规划对于控制 AI 生成的随机性至关重要,尤其是在时间紧迫的情况下,能减少无效生成的次数。 🖥️ AI 生成与迭代细节 背景生成阶段,提示词中包含了“Josef Thoma”、“Gustave Doré”、“电影布光”和“上帝之光”等关键词。 通过调整去噪强度(Denoising strength)和采样步数(50-70 步),优化了岩石洞穴的质感和光影效果。 石棺的生成过程较为曲折,尝试了“黑色石棺”、“恐怖面孔”和“发光蓝眼”等描述,但 AI 对复杂物体的理解有限。 由于 AI 难以一次性生成完美的石棺细节,创作者多次迭代后,选取最佳局部进行拼贴,以弥补整体生成的不足。 人物生成方面,目标是“穿工装裤持铲逃跑的男子”,但遇到了 AI 生成卡通化人脸或手部错误的问题。 为解决这些问题,创作者使用了多次重绘(Inpainting)和局部修复技术,逐步修正面部表情和手部结构。 在生成过程中,发现 Stable Diffusion 1.5 在生成手部和面部时优于 1.4 版本,因此优先使用 1.5 模型。 添加噪声层(Noise)被证明有助于保持构图稳定性,防止在多次迭代中画面结构发生大幅偏移。 🎨 后期合成与视觉强化 在 Photoshop 中整合各部分生成素材时,重点进行了图层叠加、蒙版调整及细节重绘。 为了表现石棺眼睛的发光效果,添加了蓝色辉光(Inner Glow/Shadow),增强了恐怖氛围。 使用 LUT(如“Crisp Winter”)统一色调,使画面色彩更加协调,并强化了整体的冷色调恐怖感。 针对人物面部缺陷尝试修复,但因时间紧迫(剩余 40 秒)未能完全解决,最终保留部分瑕疵。 使用 ESRGAN 进行图像放大,提升了最终成图的分辨率和细节清晰度。 后期合成阶段不仅是对素材的简单拼接,更是通过光影和色调的调整,将分散的元素融合为一个统一的视觉整体。 通过精细的蒙版调整,确保了各元素之间的过渡自然,避免了 AI 生成常见的边缘生硬问题。 ⚠️ 关键挑战与技术瓶颈 主要难点在于 AI 对特定复杂物体(如石棺细节、人物面部表情)的理解不稳定,导致生成结果往往需要大量后期修正。 重绘模型(Inpainting)使用不当容易导致画面崩坏,尤其是在去噪强度设置过高时,内容会发生大幅改变。 时间紧迫是最大挑战,剩余 10 分钟时仍在修复面部,剩余 40 秒时仍未完全解决面部缺陷。 这种时间压力迫使创作者在完美与完成之间做出妥协,最终保留了部分瑕疵以换取作品的完整性。 AI 生成过程中的随机性使得每次迭代都需要重新评估,增加了决策成本和时间消耗。 复杂场景的多元素整合难度远超单一物体生成,需要更高的技术熟练度和经验积累。 ⚖️ 作品对比与风格差异 自身作品完成了预设的构图计划,但在构图、光照布局及面部细节处理上耗时不足,承认经典艺术技能对 AI 出图质量至关重要。 对手作品(Patrick)采用线稿起稿,生成动物素材后手动整合,重点绘制了“上帝之光”(god rays)和细节。 对手作品呈现中世纪《权力的游戏》概念艺术风格,包含发光的鹿与池塘场景,光影理解更精准,色彩规划更清晰。 风格差异显著,自身作品侧重恐怖与黑暗,对手作品侧重史诗感与光影美学,两者在视觉传达上各有侧重。 对手在细节打磨和光照预演上投入更多时间,导致最终视觉效果更具专业感,而自身作品则更强调叙事张力。 这种对比揭示了 AI 辅助创作中,不同艺术背景和经验对最终作品质量的影响。 💡 核心结论与创作启示 AI 辅助创作仍需依赖传统艺术基础,尤其是构图与光影控制,这些是 AI 难以完全替代的核心能力。 对手在细节打磨和光照预演上投入更多时间,导致最终视觉效果更具专业感,证明了前期规划的重要性。 建议观众订阅对手频道以查看完整过程视频,并在评论区反馈对双方作品的偏好及未来选题建议。 本次挑战表明,在严格时限下,AI 创作的成功不仅取决于技术工具,更取决于创作者的艺术判断力和决策效率。 未来创作中,应更加注重前期草图的精确性和提示词的针对性,以减少后期修正的时间成本。 通过对比分析,可以明确自身在光影控制和细节处理上的不足,为后续创作提供改进方向。