AI 导演与质量
从原文到场景:为什么生成式视觉小说需要导演
生成一两张漂亮图片并不难。超过十张后,真正的问题才出现:人物必须还是同一个人,地点必须还是同一个地点,道具必须保持身份与状态,每个画面还要延续原文和上一场。把段落逐个交给图像模型,只会得到插画集,而不是可玩的视觉小说。
在一次文学改编中,我看到人物比例变化、身体悬空、同一海岸在相邻镜头中重建、音乐重新开始,以及重要戒指换手、换指甚至变成多个。于是我把生成工作改造成由文本分析、绘图、合成、MCP 代理、技术验证和 AI 导演组成的生产流程。

1. 原文先于画面
输入可以是文本、HTML、Markdown 或含文本层的 PDF。系统先记录语言、版本、章节顺序,以及原作、译本和插图的权利。romergo_inspect_story_source 和 romergo_plan_story_source 在不写入项目的情况下生成清单与预览。线性原文不能被擅自改成分支故事。
场景按地点、时间、参与者或动作的真实变化划分。每段保留精确的 sourceExcerpt,并生成视觉契约:谁在场、谁说话或倾听、做什么、看向哪里、身体由什么支撑、哪些脸必须在手机裁切后可见,以及哪些细节连接相邻镜头。
2. 人物、地点和道具有记忆
独立文本审计再次阅读原文,提取人物实际接触的物品。每件道具都有规范描述、不可变特征、持有人、状态、可见性和数量。金戒指在交付前、交付时和交付后都必须是同一枚。
场景表、人物与地点设定、道具账本、素材清单、生成任务和审计报告通过稳定 ID 与文本哈希相互引用。它们不替代作品,而是防止不同代理之间丢失决定的临时脚手架。
3. 两种构图模式
baked_narrative 用于没有直接对话的叙事场景,把人物直接融入背景,因此地面、床、石头或椅子的支撑关系更自然。layered_dialogue 用于对话,把背景与说话、倾听姿势的精灵分开,并保持正确的姓名和头像。混合模式可以存在,但必须是明确决定。
生成提示来自精确原文、地点设定和当前道具状态。文件检查会发现错误肢体、透明边缘、被裁掉的轮廓、意外文字和重复植物。但单独 PNG 仍无法说明最终舞台是否合理。
4. MCP 组装可编辑项目
获批素材进入草稿,MCP 工具创建章节、场景、文本、转场、时间线、音乐和人物位置。代理随后用 romergo_get_chapter 读取持久化结果,运行 romergo_validate_project,再通过 romergo_verify_quest_change 完成验证。成功响应不等于保存后的 runtime 正确。
5. AI 导演同时阅读文本和 Player
最终审查会在桌面和 390 × 844 手机视口完整播放章节,并在进入场景后的 0、100、500 毫秒截图,捕获黑屏、白底或短暂出现的旧精灵。导演同时获得原文、视觉契约、相邻场景和道具历史。
若背景正确而精灵悬空,选择 recompose,通过 MCP 调整位置、比例、图层或裁切。若错误姿势已画进背景,则选择 regenerate。修复后的画面必须再次独立审查。
错误 1:男主角坐到了女主角身上
在手机裁切中,Gray 的图层压在熟睡的 Assol 身上。“两人都可见”虽然为真,却毫无意义。现在每个视口都要检查支撑、深度和身体相交。

错误 2:一枚戒指变成了多枚
只检查“有金色物品”会让戒指换手、换指甚至增殖。契约现在要求恰好一枚、指定的手和手指,并记录交付前、交付时和交付后的状态。

错误 3:人物望向窗外,原文却明确相反
酒馆画面很漂亮,但原文说他们背对窗户坐着。错误方向已经融入画面,无法靠移动图层解决,必须按照原文空间关系重新生成。

从图片集合到可重复的导演流程
早期测试只检查文件、透明度、边界和图结构。只有当要求来自精确原文、Player 成为控制表面、审查能看到相邻场景与道具历史,并且每次失败都必须选择修复方式再复验时,流程才开始稳定。
这一切距离完全自动生成仍然很远。人的视觉经验、专业积累和情感判断仍是成功的首要标准;我认为短期内还无法有把握地说生成已经完全自主。
但当前流程已经为我节省了许多小时,也希望能为其他创作者节省时间。把时间留给创作,把复杂的技术例行工作交给脚本和 AI。这样文本、HTML 或 PDF 才会成为连贯作品,而不只是图片集合。