最近在整理 AI 绘画工作流时想做一个偏“场景叙事”的静态图练习让两个虚拟角色出门碰面结果被大太阳晒得不想走。这个题材既考验角色一致性又考验场景构图和光影描述很适合用来梳理一套从提示词到成图的完整流程。本文就以“七海去找星瞳玩但是路上太晒了”这个创意为线索完整拆解 AI 静态图生成从想法到成图的全部环节包括模型选择、提示词设计、ControlNet 辅助、参数调整、常见出错点和工程化建议。不管你是刚接触 AI 绘画还是已经在用 Stable Diffusion 或 ComfyUI 做图这篇都能帮你把流程跑通。1. 项目背景与核心概念1.1 这个项目要做什么先说人话项目目标是用 AI 生成一张静态图片画面内容是“一个叫七海的虚拟角色在大太阳底下走向另一个叫星瞳的角色所在地中间被晒得非常难受”。这个标题本质是一个漫画分镜式的静态场景角色七海、星瞳两个虚拟角色。情境七海出门找星瞳玩。冲突天气太晒七海在路上被晒得蔫蔫的。输出一张能够讲故事的高质量静态图。用 AI 制作这种图难点不在于“画一个角色”而在于“把这个特定的角色放到一个符合设定的场景里并且让画面有情绪、有故事感”。这就需要组合使用图像生成模型的多种能力。1.2 什么是 AI 静态图生成AI 静态图生成是指用深度生成模型从文字描述Prompt或草图、姿态、参考图等条件输入直接生成一张静止图片的技术流程。当前最常见的开源方案是 Stable Diffusion 及围绕它构建的 WebUI / ComfyUI 工具链。它与 AI 视频生成的区别在于对比项AI 静态图生成AI 视频生成输出形态单张图片多帧连续视频关键难点构图、光影、细节质感时序一致性、动作连贯性常用工具SD WebUI、ComfyUI、MidjourneyRunway、Pika、AnimateDiff硬件要求相对较低更高显存与算力本文讨论的是“AI 静态”方向也就是先用静态图把角色设定和场景氛围做扎实。做视频也可以沿用同样的角色底图作为首帧参考。1.3 常见应用场景类似“角色 天气 出行 情绪”的静态图在实际工作中很常见虚拟主播 / 虚拟 IP 的日常动态配图。漫画、条漫、插画项目的分镜预览。短视频封面的视觉方案测试。品牌 IP 出街物料的小样图。游戏设定集、同人合志的角色互动插图。掌握这套流程不只是能“生成一张图”而是能围绕一个创意快速产出可控的视觉方案。1.4 为什么需要掌握提示词与参数控制很多人一开始用 AI 出图觉得只要输入一句话就能出好图实际上只有极少数运气好的情况是这样。真正的可控出图需要理解几个基础概念提示词Prompt给模型的文字指令决定画什么。负向提示词Negative Prompt告诉模型不要出现什么比如不要崩脸、不要多手指。采样步数Steps去噪迭代次数影响细节和速度。CFG Scale提示词对画面的影响强度。ControlNet通过姿态、线稿、深度图等额外条件控制画面结构。LoRA小型模型插件用于固定特定角色、画风或物体。这几个概念会贯穿整个项目。2. 环境准备与版本说明2.1 推荐运行环境因为不同时间模型和工具版本变化很快这里不写死某个具体版本号只给出通用的最低配置建议操作系统Windows 10/11、Ubuntu 20.04、macOSApple Silicon 可跑但速度受限。显卡NVIDIA 显卡显存建议 8GB 以上6GB 显存也能跑但大分辨率容易爆显存。内存16GB 以上建议。硬盘预留 50GB 以上因为模型文件和 LoRA 文件占用空间较大。Python如果你用 SD WebUI安装包通常自带 Python 环境如果手动部署 ComfyUI建议 Python 3.10 或 3.11。2.2 工具链选择目前主流的本地 AI 绘画工具有两个工具特点适合人群Stable Diffusion WebUIAUTOMATIC1111插件丰富上手门槛低教程多新手、快速验证方案ComfyUI节点式工作流灵活高效可控性强进阶开发者、流程复用需求高的人本文示例以 Stable Diffusion WebUI 为主来讲解因为它的界面直观适合跑通完整流程。如果你已经会用 ComfyUI可以把同样的提示词和参数迁移到节点工作流里。2.3 需要准备的模型文件注意模型文件不要随意从不可靠渠道下载。建议从 Hugging Face、CivitAI 官网或模型作者指定渠道获取。需要准备底模Base Model建议先用当前社区常用的写实/二次元混合模型这类模型对角色表现友好。角色 LoRA如果要固定“七海”“星瞳”的具体角色形象最好找到对应角色的 LoRA 模型没有的话也可以用角色标签 参考图 ControlNet 的方式模拟。VAE用于改善色彩表现一般随底模提供也可以在设置里指定。ControlNet 模型包括 canny、depth、openpose 等用于结构控制。版本差异很大建议按“当前主流版本”安装并且先跑通默认示例再更换模型。3. 核心原理提示词、LoRA 与 ControlNet在写提示词之前先把三个最关键的机制讲清楚这样你在调参时才知道自己在干什么。3.1 提示词的工作原理Stable Diffusion 不是“理解”文字而是把文字通过 CLIP 文本编码器转换成一组向量再引导图像生成过程朝这个方向去噪。因此提示词写得太抽象模型难以抓住重点。不同单词权重不同越靠前通常影响越大部分采样器表现不同。用英文写效果通常比中文稳定因为模型训练语料以英文为主。所以本文的提示词示例会使用英文关键词并在后面附上中文说明。3.2 LoRA让角色变成“这个人”底模能画出“一个好看的少女”但画不出“七海”或“星瞳”这种特定角色因为底模训练时没有这个角色。LoRA 是一种轻量微调模型通常只有几十到几百 MB通过叠加在底模上让模型学会特定角色或风格。使用 LoRA 时的典型提示词格式如下lora:qihai_v1:0.8这句的意思是加载名为qihai_v1的 LoRA权重为 0.8。权重太高容易出现画风过拟合、背景崩坏太低则角色特征不明显一般从 0.7 到 0.9 开始调。如果没有找到角色 LoRA可以退而求其次用“角色特征标签 参考图 ControlNet”的方式。比如输入1girl, blue hair, ahoge, blue eyes, sailor uniform, solo再加上一张参考图通过 IP-Adapter 或 ControlNet 来控制角色特征。这个方案的稳定性比 LoRA 差但可以解决“找不到 LoRA”的问题。3.3 ControlNet控制“她在走、天很亮、路很晒”ControlNet 是结构控制的核心。它的作用是读取一张额外图像比如线稿、深度图、姿态骨架把其中的空间信息作为生成条件引导画面的构图。在“七海去找星瞳玩”这个场景中我们可能需要OpenPose姿态控制控制角色是行走姿态、抬手遮阳姿态还是蹲下蔫掉的姿态。Canny / Lineart边缘控制固定整体构图范围防止画面元素乱飞。Depth深度控制如果需要复杂街景或道路纵深用深度图控制远近关系。要注意ControlNet 并不直接生成内容它更像“几何约束”配合提示词才能发挥最大作用。4. 完整实战生成“七海去找星瞳玩但是路上太晒了”下面进入实操环节。我会以 Stable Diffusion WebUI 为例演示从空画布到成图的完整流程。4.1 创建项目目录与准备素材首先在本地创建一个工作目录方便存放底图、参考图和输出图mkdir -p ai-scene-七海星瞳/{inputs,models,outputs} cd ai-scene-七海星瞳建议目录结构如下ai-scene-七海星瞳/ ├── inputs/ # 参考图、线稿、姿态图 ├── models/ # LoRA、ControlNet 模型 └── outputs/ # 生成结果同时准备一组“角色特征词”哪怕暂时没有 LoRA也能通过标签尽量贴近角色设定。可以先用下面这些通用标签做底七海方向蓝发、单马尾、元气、运动感、眼睛颜色偏蓝。星瞳方向浅色长发、比较柔和、文静感、偏素色服装。注意以上是示例性描述真实角色设定请以官方资料或你手头的授权素材为准。做同人图尤其是公开传播时要注意版权和角色使用规范。4.2 设置基础参数打开 Stable Diffusion WebUI切到 txt2img 页签先设置一组稳定的基础参数参数建议值说明Sampling methodDPM 2M Karras出图稳定细节可观Sampling steps28常规质量兼顾效率Width768横构图适合“路上行走”场景Height512配合 768 形成约 3:2 的画面CFG Scale7太高容易过饱和太低不贴提示词Seed-1随机先随机试效果找到好构图再固定4.3 编写正向提示词正向提示词分三层写内容主体、场景氛围、画质细节。masterpiece, best quality, highres, 1girl, blue hair, ahoge, blue eyes, school uniform, walking, outdoors, street, summer, clear sky, intense sunlight, sweating, tired expression, squinting, hand shading eyes, distant figures, heat shimmer, road perspective, dynamic angle, cinematic lighting, depth of field逐段解释masterpiece, best quality, highres提高画面整体质量。1girl, blue hair, ahoge, blue eyes, school uniform, walking定义角色基本外观和行为。outdoors, street, summer, clear sky, intense sunlight定义场景是夏天、户外、晴天、强烈阳光。sweating, tired expression, squinting, hand shading eyes定义“太晒了”的情绪和动作。distant figures, heat shimmer, road perspective暗示她正走在去见朋友那条路上远方有一道身影。dynamic angle, cinematic lighting, depth of field提升画面电影感。如果你有七海和星瞳对应的 LoRA可以在正向提示词中加入lora:qihai_v1:0.8并把远方的角色描述补上例如1girl, light long hair, soft expression, waiting, in distance4.4 编写负向提示词负向提示词负责排除常见翻车因素。bad hands, missing fingers, extra fingers, mutated hands, bad anatomy, deformed face, extra limbs, bad proportions, lowres, worst quality, low quality, bad quality, jpeg artifacts, signature, watermark, username, text, logo, blurry, out of focus, overexposed, washed out说明前两组主要处理人物结构错误。中间一组处理清晰度和低质量。最后一组处理画面干扰元素。如果你不希望画面出现文字一定要写text和logo。4.5 第一次生成与观察点击 Generate生成第一张图。不要指望第一张就完美。你需要观察几个方面构图是否符合“走在路上”的纵深感角色是否像目标角色如果完全不像考虑加 LoRA 或使用参考图。“晒”的感觉是否明显如果画面太凉爽需要强化阳光、汗水和表情描述。是否有结构错误重点看手、脸、脚。如果第一张就基本构图合理但细节不行恭喜方向对了。接下来是在这个基础上精修。4.6 使用 ControlNet 固定构图当随机构图总是不稳定时用 ControlNet 控制“行走姿态”和“道路透视”。第一种方式OpenPose 控制姿态。你可以先用一张自己摆拍或找到的、授权可用的行走姿态图片作为姿态参考。ControlNet 的 OpenPose 处理器会提取骨架然后生成时让角色保持同样的动作。WebUI 中操作步骤打开 ControlNet 面板。上传姿态参考图。预处理器选择openpose。模型选择对应的control_v11p_sd15_openpose或新版控制模型。权重设为 0.6 到 0.8避免姿态僵硬。第二种方式Canny 控制构图线稿。如果你先用任意工具画了一张简单的场景草图道路、太阳位置、人物大小关系可以把草图导入 ControlNet选择canny或lineart权重设为 0.3 到 0.5。这样既能保留草图骨架又不会让提示词完全失效。比如简单的构图草图可以是这样画面左侧 1/3角色七海弯腰、手遮额头。画面中央偏右笔直向前的道路。画面右上角太阳。远处道路尽头一个小身影星瞳。ControlNet 的意义在于把脑子里构图直接变成模型的“空间约束”是解决“AI 乱放飞构图”的核心手段。4.7 参数调整清单如果你出图效果不理想按以下顺序调问题调整思路画面不像角色增加 LoRA 权重补充角色特征词用参考图 IP-Adapter晒的感觉不够加入sun glare, sunburn, heat haze, sweat drops, exhausted expression构图太散开启 ControlNet固定 seed降低 CFG 到 5~6画面过曝负向提示词加overexposed, washed out降低 CFG崩脸、崩手加大负面提示词直接用 inpaint 修复局部角色和场景不协调减少 LoRA 权重换底模调整 ControlNet 权重4.8 后期修复与出大图当小图画质已满足要求可以进入图生图放大阶段。在 img2img 页签中把生成好的小图上传参考值设置缩放倍数2 倍。Denoising strength0.3 到 0.5越低越接近原图太高会改细节。放大算法推荐 ESRGAN_4x 或 R-ESRGAN 4x Anime6B二次元图更友好。大图出来后如果发现局部崩坏用局部重绘在 img2img 页面打开 Inpaint 模式。涂抹需要修复的手、脸区域。修改局部提示词比如close-up, detailed hands, perfect hands。Denoising strength 保持在 0.4 左右。这样一张“主人公在烈日下行走”的静态图就完成了。5. 常见问题与排查思路AI 出图最怕的不是“图丑”而是“图丑但你不知道是哪里出了问题”。下面整理几类高频问题。5.1 角色完全不像目标角色可能原因解决思路没有使用 LoRA添加角色 LoRA并确认触发词角色特征词写错检查发色、瞳色、发型、服饰等特征标签底模画风偏差大换更贴近原角色的底模权重过高导致过拟合降低 LoRA 权重到 0.6~0.8角色一致性是这类项目最容易踩的坑。建议每次出图保持相同 positive prompt 的前半部分只修改场景部分。5.2 画面里没有“夏天的感觉”可能原因解决思路场景词太弱加入scorching sun, high noon, heat wave情绪动作不够加入hand shading eyes, sweating, exhausted光线不明确加入hard sunlight, strong shadows, sun flare色调偏冷在后期用调色工具增加暖色滤镜5.3 手指、眼睛崩坏可能原因解决思路模型分辨率不足使用高清放大或局部重绘负面提示词不够增加bad hands, missing fingers, extra fingers手指区域太小重绘时把脸部/手部区域裁剪出来单独修复采样器不适合尝试换 Euler a 或 DPM SDE Karras5.4 显存不足 / 报错 CUDA out of memory可能原因解决思路分辨率设置过高降低到 512x512 或 512x768batch size 过大设 batch size 1ControlNet 多个同时开启一次先只用一个控制条件模型量级过大使用 fp16 版本开启medvram启动参数WebUI 启动时可以用python launch.py --medvram实测对 6GB 显存用户非常友好。5.5 每次出图都不一样难以复现可能原因解决思路Seed 没有固定每次生成后复制 seed 到固定输入框部分参数随机化关闭任何随机噪声变化插件采样器/步数变化记录参数用同一套配置复现建议建立一个“出图配方记录表”把每次满意图的提示词、负向提示词、参数、模型、权重全部记录下来。这是工程化出图的起点。6. 最佳实践与工程建议基于上面的实战过程下面整理几条在真实项目里更重要的经验。6.1 提示词模板化不要把提示词当成一段“一次性文本”而是拆成可复用的模块角色模块角色名、特征词、LoRA。动作模块walking、sitting、running。场景模块time、weather、place。情绪模块expression、sweating、feeling。画质模块masterpiece、best quality、highres。下次做新图时只需要替换动作模块和场景模块角色模块保持不动就能维持角色一致性。6.2 用配方管理取代随机碰运气“刚才那张图好看但我忘了参数”是新手的常态。建议使用 CSV 文件或 Notion 表格记录项目名七海找星瞳玩 seed123456789 模型xxxxMix_v30 LoRAqihai_v1:0.8 CFG7 steps28 prompt…… negative…… 结果满意可用于第二次细化这个习惯能让你在 100 张实验图中快速找到最优秀的那批参数组合。6.3 版权与合规注意事项这是很重要但常被忽略的一条不是所有角色、模型都能随意商用。角色权七海、星瞳等角色的版权归官方所有同人创作前要了解官方关于二次创作的许可范围。模型权下载底模和 LoRA 时注意页面标注的使用许可以及是否允许商用。数据权使用参考图时确保你对该图片来源有使用权。内容合规不要生成违法、低俗、违背公序良俗的内容。AI 让创作门槛降低了但法律和伦理的红线并没有消失。合规创作才能走得更远。6.4 图像后处理不可忽略很多 AI 图单看生成结果一般但经过后期处理后会非常出彩。建议在生成后用 Topaz Gigapixel 或 WebUI 自带放大提升分辨率。用 PS 或轻量工具调整色温强化夏日暖阳感。增加轻微噪点降低“AI 光滑塑料感”。给画面加字幕或对话框增强“静态剧情”叙事性。6.5 从单图到系列的扩展如果你已经能稳定生成一张“七海被太阳晒到”的图就可以开始做系列连续动作三连拍路途中、擦汗、终于到达。不同时间段正午、午后、黄昏。不同距离远景人小、中景半身、近景特写。这种“同角色、多场景、连续叙事”的组合是虚拟 IP 内容运营和短视频封面创作的高级能力。7. 总结本文从一个具体的创作项目“七海去找星瞳玩但是路上太晒了”出发完整梳理了 AI 静态图生成的实战流程从环境准备、模型选择到提示词编写、ControlNet 控制、参数调优、局部重绘和放大输出最后汇总了高频问题和工程化建议。核心收获可以概括为三点提示词不是玄学它是结构化描述可以拆成角色、动作、场景、情绪、画质五个模块。角色一致性优先靠 LoRA构图稳定性优先靠 ControlNet两者结合能让画面“对味”。出图只是开始筛选、记录、修复、后处理才是能稳定产出高质量作品的关键。如果你接下来想继续进阶可以尝试把这些静态图工作流迁移到 ComfyUI使用节点式工作流把“角色模板 场景模板 控制条件”做成可复用流程到那时批量出图和系列作品创作会变得很轻松。