בימוי AI ואיכות

מהמקור לסצנה: למה רומן חזותי שנוצר צריך במאי

קל יחסית ליצור תמונה יפה אחת או שתיים. הקושי מתחיל אחרי התמונה העשירית: הדמות חייבת להישאר אותו אדם, המקום אותו מקום, החפץ עם אותה זהות ומצב, וכל פריים צריך להמשיך את המקור ואת הסצנה הקודמת. שליחת פסקאות בודדות למודל תמונה יוצרת אלבום איורים, לא רומן חזותי עובד.

בעיבוד ספרותי ראיתי דמויות משנות קנה מידה, מרחפות, בונות מחדש את אותו חוף, מפעילות את המוזיקה מחדש ומעבירות טבעת חשובה בין ידיים ואצבעות או מכפילות אותה. לכן הפכתי את ההפקה ל-pipeline עם מנתח טקסט, אמן, compositor, סוכן MCP, בדיקה טכנית ובמאי AI.

![תהליך Romergo מהמקור ומבנה הסיפור דרך מסמכי המשכיות, assets והרכבת MCP ועד בדיקת הבמאי](direction-flow)

1. המקור קודם לתמונה

הקלט יכול להיות טקסט, HTML, Markdown או PDF טקסטואלי. תחילה מתעדים שפה, מהדורה, סדר פרקים וזכויות על המקור, התרגום והאיורים. romergo_inspect_story_source ו-romergo_plan_story_source יוצרים מלאי ותצוגה מקדימה בלי לכתוב את הפרויקט. אין להמציא ענפים למקור ליניארי.

מחלקים סצנה כאשר מקום, זמן, משתתפים או פעולה משתנים באמת. כל סצנה שומרת sourceExcerpt מדויק וחוזה חזותי: נוכחות, דובר ומאזינים, פעולה, כיוון מבט, תמיכה פיזית, פנים שחייבות לשרוד crop בנייד ועוגנים המחברים פריימים סמוכים.

2. לדמויות, מקומות וחפצים יש זיכרון

מבקר טקסט עצמאי קורא שוב את הקטע ומחלץ כל חפץ שנוגעים בו. כל prop מקבל תיאור קנוני, מאפיינים קבועים, מחזיק, מצב, נראות ומספר עותקים. טבעת זהב צריכה להיות אותה טבעת יחידה לפני ההעברה, במהלכה ואחריה.

מפת הסצנות, מסמכי הדמויות והמקומות, יומן החפצים, manifest ה-assets, משימות היצירה ודוחות הביקורת מקושרים באמצעות ID יציב ו-hash של המקור. הם אינם מחליפים את היצירה; הם מונעים מהחלטות להיעלם בין סוכנים.

3. שני מצבי קומפוזיציה

baked_narrative משלב דמויות ברקע בסצנת קריינות ללא דיבור ישיר, כך שמגע עם קרקע, מיטה, אבן או כיסא נפתר בתוך תמונה אחת. layered_dialogue משאיר רקע ו-sprites של דיבור והקשבה נפרדים ושומר שם ודיוקן נכונים. מצב משולב אפשרי, אך רק כהחלטה מפורשת.

היצירה מתחילה מהקטע המדויק, מסמך המקום ומצב החפץ הנוכחי. QA לקובץ מחפש אנטומיה שבורה, הילה בשקיפות, צללית חתוכה, טקסט מקרי וצמחייה חוזרת. PNG בודד עדיין לא יכול לשפוט את הבימוי הסופי.

4. MCP מרכיב פרויקט שניתן לעריכה

Assets שאושרו נכנסים לטיוטה. כלי MCP יוצרים פרקים, סצנות, טקסט, מעברים, timeline, מוזיקה ומיקום. הסוכן קורא את המצב עם romergo_get_chapter, מריץ romergo_validate_project ומסיים עם romergo_verify_quest_change. הודעת הצלחה אינה הוכחה למצב המתמיד ול-runtime.

5. במאי ה-AI קורא את הטקסט ורואה את Player

הבדיקה הסופית מריצה את כל הפרק ב-desktop וב-390 × 844. צילומים ב-0, 100 ו-500 מילישניות חושפים מסך שחור, רקע לבן או sprite ישן במעבר. יחד עם התמונה מקבל הבמאי את הטקסט, החוזה, הסצנות הסמוכות והיסטוריית החפצים.

אם הרקע נכון אך sprite מרחף, בוחרים recompose ומשנים דרך MCP מיקום, קנה מידה, שכבה או crop. אם התנוחה השגויה כבר מצוירת ברקע, בוחרים regenerate. ה-render החדש נבדק שוב באופן עצמאי.

שגיאה 1. הגיבור ישב על הגיבורה

בחיתוך לנייד שכבת Gray נפלה על Assol הישנה. “שתי הדמויות נראות” היה נכון אך חסר משמעות. כל viewport בודק כעת תמיכה, עומק וחפיפת גוף.

![פריים נייד שבו Gray חופף את Assol הישנה](direction-failure-overlap)

שגיאה 2. טבעת אחת הפכה לכמה

בדיקת חפץ זהוב בלבד אפשרה לטבעת להחליף יד ואצבע או להתרבות. החוזה דורש כעת עותק אחד בדיוק, יד ואצבע מוגדרות ומצבים לפני, בזמן ואחרי ההעברה.

![תשעה חיתוכים עם מיקום טבעת שגוי: מחוץ לאצבע, מרחפת לידה או על האצבע הלא נכונה](direction-failure-ring)

שגיאה 3. הדמויות הביטו בחלון בניגוד לטקסט

תמונת הפונדק הייתה יפה, אך המקור אמר שהגברים ישבו בגבם אל החלון. הכיוון השגוי כבר נצרב בתמונה; הזזה לא תתקן אותו ונדרשה יצירה מחדש.

![סצנת פונדק שבה הדמויות מביטות לחלון בניגוד להוראת המקור](direction-failure-window)

מאוסף תמונות לבימוי שניתן לשחזר

הבדיקות הראשונות בחנו רק קובץ, alpha, גבולות וגרף. האמינות הופיעה כאשר הדרישות הגיעו מהטקסט המדויק, Player הפך למשטח הבקרה, הביקורת ראתה סצנות סמוכות והיסטוריית חפצים, וכל כשל היה חייב לבחור תיקון ולעבור בדיקה חוזרת.

כל זה עדיין רחוק מיצירה אוטומטית מלאה. ניסיון חזותי, מקצועיות ורגש אנושיים נשארים המדד העיקרי להצלחה, ואינני חושב שאוכל לומר בקרוב בביטחון שהיצירה אוטונומית לחלוטין.

ובכל זאת ה-pipeline הנוכחי כבר חוסך לי שעות רבות, ואני מקווה שיחסוך זמן גם ליוצרים אחרים. השאירו זמן ליצירה והפקידו את השגרה הטכנית המורכבת בידי scripts ו-AI. כך טקסט, HTML או PDF הופך ליצירה עקבית ולא רק לאוסף תמונות.

חזרה לבלוג הפיתוח