AI による演出と品質
ソースからシーンへ:生成されたビジュアルノベルにディレクターが必要な理由
1 つまたは 2 つの魅力的な画像を生成するのは比較的簡単です。本当の難しさは 10 枚目の画像以降から始まります。キャラクターは同じ人物であり、場所は同じ場所であり、小道具は同じオブジェクトであり、すべてのフレームはソースと前のシーンの両方を継続する必要があります。画像モデルに段落を次々と送信すると、実用的なビジュアルノベルではなく、イラストのアルバムが作成されます。
文学作品を翻案しているときにこれに遭遇しました。個々の画像は説得力があるように見えましたが、それらを組み合わせると、個別の資産チェックでは検出できなかった失敗が明らかになりました。ヒーローのサイズが変更され、人々が地面の上に浮かび上がり、隣接するショット間で同じ海岸が再構築され、音楽が再開され、重要な指輪が別の手、別の指に移動、または複数になりました。
したがって、Generation は、テキスト アナリスト、アーティスト、コンポジター、MCP エージェント、テクニカル バリデーター、AI ディレクターという個別の役割を持つ制作パイプラインになりました。その主な出力は画像ではありません。これは、ソース、シーン、そのアセット、およびプレイヤーが Player で実際に見るものとの間の検証可能な接続です。

1. 何かを描く前にソースを修正する
入力は、プレーン テキスト、HTML、マークダウン、またはテキスト ベースの PDF の場合があります。エージェントはまず、言語、エディション、章の順序、および利用可能なテキスト レイヤーを記録します。オリジナル、特定の翻訳、および埋め込まれたイラストに対する権利は個別に確認されます。古い作品であっても、すべての翻訳が自動的に出版可能になるわけではありません。
romergo_inspect_story_source と romergo_plan_story_source は、プロジェクトを作成せずにインベントリを構築してプレビューできます。この段階では、作業を「改善」したり、分岐を考案したりしてはなりません。線形ソースでも線形グラフが生成されるはずです。
2. テキストを連続したシーンに分割する
シーンの境界は、段落の長さではなく、場所、時間、参加者、またはアクションの変化によって定義されます。すべてのセグメントは正確な sourceExcerpt を保持し、視覚的なコントラクトを受け取ります。
- 場所、時間、物理的な参加者。
- 話し手、聞き手、そして行動。
- 視線ターゲットと目に見えるサポート。
- 表示する必要がある詳細。
- 移動トリミングに耐えなければならない顔。
- 隣接するショットを接続するアンカー。
これはもう監督の故障です。 「彼らは窓に背を向けて座っていた」という表現は、ジェネレーターが無視するような装飾的な散文ではなく、テスト可能な身体の向きの要件になります。
3. 独立した監査人に裏付けと状態を抽出させる
プランナーは細部を見逃す可能性があるため、別のテキスト監査人が正確な抜粋を再度読み取り、キャラクターが触れたすべてのオブジェクト (本、釣り竿、ボトル、時計、指輪など) を抽出します。
各オブジェクトは、正規の説明、不変の特性、所有者、状態、可視性、インスタンス数、およびイベント チェーンを含む連続性台帳に入力されます。たとえば、「薄い金の指輪」は、移送前にグレイの特定の手と指に残っています。それはアクション中に彼の指とアソルの小指の間に見えます。その後、それはグレイから消え、アソルの小指に残ります。
これは、「継続性を維持する」という一般的なプロンプトよりも強力です。レビューはリングが存在することだけでなく、それがどのビートに属しているかを正確に把握します。
4. 一時的な文書が生産グラフを形成する
長い章を 1 つのプロンプト内に含めることはできません。パイプラインは、安定した ID とソース抜粋のハッシュによってリンクされた一時ドキュメントを作成します。
- シーン マップにはテキストの境界と視覚的なコントラクトが保存されます。
- キャラクターバイブルは、顔、年齢、身長、服装、ポーズの語彙を修正します。
- ロケーションバイブルには、幾何学模様、光、繰り返し現れるランドマークが記録されています。
- 小道具台帳には身元、所有者、状態の変更が記録されます。
- アセット マニフェストは、シーンを背景、ポーズ、ポートレートにマップします。
- 生成ジョブは、正確な表現のために必要な特性を繰り返します。
- 監査レポートは、SHA-256 によって正確なレンダリングに関連付けられます。
これらのファイルは文学的情報源を置き換えるものではなく、クエストとともに公開されるものでもありません。これらは足場です。すべての決定を説明し、失敗したステップのみをシステムに繰り返しさせ、エージェント間で詳細が失われるのを防ぎます。
5. シーンには 2 つの主な表現モードがあります
すべてのシーンを同じ方法で組み立てる必要はありません。
baked_narrative は、直接話さないナレーション用です。キャラクターは背景に生成されるため、照明、地面との接触、座る、横になる、小道具のインタラクションが自然に見えるようになります。複数の連続したイラストを 1 つのユニバーサル背景に置き換えることができます。
layered_dialogue は会話用です。話すポーズと聞くポーズが別個のスプライトのままである間、位置は安定します。セリフによって反応が変わり、セリフカードは名前と顔を正確に保つことができます。
ハイブリッドも可能ですが、明示的です。眠っているヒロインは背景に焼き付けられますが、近づいてくる船員はスプライトのままです。偶発的なレイヤーの混合は、物理的に不可能なステージングを作成する最速の方法の 1 つです。
6. 正確なシーンから生成
キャラクターのアイデンティティの参照と世界のビジュアルスタイルが最優先されます。その後、シーンは一度に 1 つずつ処理されます。バックグラウンド プロンプトは、正確な抜粋、場所の聖書、および現在のプロップの状態から構築されます。その後初めて、パイプラインは既存のポーズを選択するか、不足している話し方、聞き方、またはアクションのポーズを生成します。
アセット QA は、余分な手足、壊れた手、写真内のテキスト、反復的な葉、溶けた枝、透明なハロー、切り取られたシルエットを検出します。しかし、孤立した PNG では、最後のシーンで人物が正しく立っているかどうかを判断できません。それには次の層が必要です。
7. MCP は通常の編集可能なプロジェクトをアセンブルします
承認されたアセットはドラフトに入り、MCP ツールはチャプター、シーン、テキスト、グラフ トランジション、タイムライン、音楽、キャラクターの配置を作成します。これはフラット化されたイメージのエクスポートではありません。Builder で開いて変更できる通常の Romergo プロジェクトのままです。
すべての書き込みの後に永続的なリードバックが続きます。エージェントは romergo_get_chapter を使用し、romergo_validate_project を実行し、romergo_verify_quest_change まで終了します。このチェックでは、ツールの応答が成功したかどうかだけでなく、保存された関係、メディア参照、実行時の表現も対象となります。
8. AI ディレクターがテキストと最終フレームを一緒に読みます
最終レビューはソース PNG に対してではなく、Player で行われます。チャプター全体は、デスクトップおよび 390 × 844 で再生されます。シーン開始後の 0、100、および 500 ミリ秒のフレームでは、黒いトランジション、白いマット、および短時間しか表示されない古いスプライトが露出します。
ディレクターはフレームごとに、正確な抜粋、視覚的なコントラクト、隣接するシーンのコンテキスト、およびスクリーンショットを受け取ります。ソースの忠実度、物理的なサポート、相対的なスケール、オクルージョン、視線ロジック、位置とプロップの連続性、モバイルセーフな顔、対話の同一性、テキストシーケンス、および中断のない音楽をチェックします。
評決では修復を指示する必要がある。背景は正しいがスプライトが浮いている場合、MCP は位置、スケール、レイヤー、またはトリミングを再構成できます。間違ったポーズが背景に焼き付けられた場合、アセットを再生成する必要があります。その後、新しいレンダリングが再度レビューされます。
新しいルールを生み出した3つの失敗
失敗 1. ヒーローは文字通りヒロインの上に座りました
広い構図は許容できるように見えましたが、モバイル クロップによりレイヤーが結合されました。グレイの膝が眠っているアソルの上に着地しました。 「両方の文字が表示される」というのは技術的には真実であり、まったく不十分でした。レビューでは、すべてのビューポートでサポート、深さ、ボディの交差について推論する必要があります。レイヤー化されたシーンには recompose が必要です。融合されたイメージには regenerate が必要です。

失敗2. 一つの指輪が複数になり、持ち手が変わった
金のオブジェクトだけをチェックするのは弱すぎました。資産全体で、指輪は別の手や指に移動し、場合によっては増加しました。現在、コントラクトには、特定の解剖学的側面と指、さらに前、中、後の状態の 1 つのインスタンスが必要です。

失敗 3. テキストでは反対のことが書かれているにもかかわらず、文字が窓から見えた
居酒屋でのショットは魅力的だったが、情報筋は、男たちはうっかり振り向かないように窓に背を向けて座っていたとはっきりと述べた。これはレイアウトの問題ではありません。間違った向きが画像に焼き付けられています。ソースの空間的制約をそのまま記載して再生成する必要があります。

以前のチェックで見逃された理由
初期のチェックはローカルで、ファイルが存在し、アルファが存在し、文字がフレームに適合し、グラフのエッジが接続されていました。それぞれが狭い質問に答えましたが、ソース動詞、最終ポーズ、モバイル クロップ、小道具の履歴を 1 回のパスで比較する人はいませんでした。
信頼性は、要件が正確なテキストから得られた場合にのみ向上し、Player が制御面となり、レビューが隣接するシーンと小道具履歴を受信し、すべての失敗が修復とその後の独立した再実行を選択する必要がありました。
結果として得られるのは、写真の山ではなく、再現可能な方向性です。
これらすべてが完全に自動生成されるにはまだ程遠いです。人間の視覚リテラシー、経験、感情が依然として成功の主な尺度です。私は、すぐに世代が完全に自律的であると自信を持って言えるとは期待していません。
現在のパイプラインのおかげで私はすでに多くの時間を節約できていますが、他のクリエイターの時間も節約できることを願っています。クリエイティブな仕事に時間を費やしましょう。スクリプトと AI に難しい技術的なルーチンを実行させます。
これが、テキスト、HTML、または PDF が実用的なビジュアルノベルになる方法です。ソースは事実を確立し、契約はそれらをテスト可能にし、生成は必要な表現を作成し、MCP は編集可能なプロジェクトを組み立て、ディレクター レビューは完成したエクスペリエンスをテキストと比較します。そうして初めて、別々の魅力的なイメージが 1 つの物語のように動き始めるのです。