AI निर्देशन और गुणवत्ता
स्रोत से दृश्य तक: जनरेट की गई विज़ुअल नॉवेल को निर्देशक क्यों चाहिए
एक-दो सुंदर चित्र बनाना आसान है। असली कठिनाई दस के बाद शुरू होती है: पात्र वही व्यक्ति रहे, स्थान वही रहे, वस्तु की पहचान और स्थिति बनी रहे, और हर फ्रेम मूल पाठ तथा पिछले दृश्य को आगे बढ़ाए। अलग-अलग अनुच्छेद इमेज मॉडल को देने से चित्रों का संग्रह बनता है, चलती हुई विज़ुअल नॉवेल नहीं।
एक साहित्यिक रूपांतरण में मैंने पात्रों का आकार बदलते, लोगों को हवा में लटकते, उसी समुद्रतट को अगले शॉट में बदलते, संगीत को फिर शुरू होते और महत्वपूर्ण अंगूठी को हाथ, उंगली या संख्या बदलते देखा। इसलिए मैंने टेक्स्ट विश्लेषक, कलाकार, कंपोज़िटर, MCP एजेंट, तकनीकी जाँच और AI निर्देशक वाला उत्पादन flow बनाया।

1. चित्र से पहले स्रोत तय होता है
इनपुट text, HTML, Markdown या text-based PDF हो सकता है। पहले भाषा, संस्करण, अध्याय क्रम और मूल, अनुवाद तथा चित्रों के अधिकार दर्ज होते हैं। romergo_inspect_story_source और romergo_plan_story_source बिना project लिखे inventory और preview बनाते हैं। Linear source में मनगढ़ंत branches नहीं जोड़ी जातीं।
स्थान, समय, पात्र या क्रिया सच में बदलने पर scene टूटता है। हर scene अपना सही sourceExcerpt और visual contract रखता है: कौन मौजूद है, कौन बोल या सुन रहा है, क्या कर रहा है, कहाँ देख रहा है, शरीर किस पर टिका है, mobile crop में कौन-सा चेहरा बचना चाहिए और कौन-सी detail अगले scene से जुड़ती है।
2. पात्र, स्थान और props की स्मृति होती है
एक स्वतंत्र text auditor अंश को फिर पढ़ता और छुई गई वस्तुएँ निकालता है। हर prop का canonical description, स्थायी गुण, holder, state, visibility और count दर्ज होता है। सोने की अंगूठी transfer से पहले, दौरान और बाद में वही एक अंगूठी रहनी चाहिए।
Scene map, character और location bibles, prop ledger, asset manifest, generation jobs और audit reports stable IDs तथा source hash से जुड़े रहते हैं। ये पुस्तक की जगह नहीं लेते; एजेंटों के बीच निर्णय खोने से रोकते हैं।
3. Composition के दो mode
baked_narrative बिना direct dialogue वाले narrative scene में पात्र को background में शामिल करता है, जिससे जमीन, बिस्तर, पत्थर या कुर्सी का सहारा स्वाभाविक रहता है। layered_dialogue बातचीत के लिए background और speaking/listening sprites अलग रखता है और सही नाम व portrait दिखाता है। Hybrid mode सम्भव है, पर उसे स्पष्ट निर्णय होना चाहिए।
Generation सही excerpt, location bible और current prop state से शुरू होती है। File QA टूटी anatomy, transparency halo, कटी silhouette, अनचाहा text और दोहराती vegetation खोजता है। फिर भी अकेला PNG final staging नहीं बता सकता।
4. MCP editable project बनाता है
Approved assets draft में जाते हैं। MCP tools chapters, scenes, text, transitions, timeline, music और placement बनाते हैं। Agent romergo_get_chapter से saved state पढ़ता, romergo_validate_project चलाता और romergo_verify_quest_change से पूरा करता है। Tool का success message persisted runtime का प्रमाण नहीं है।
5. AI निर्देशक text और Player दोनों देखता है
Final review desktop और 390 × 844 पर पूरा chapter चलाता है। Scene entry के 0, 100 और 500 ms screenshots black screen, white background या पुराने sprite की झलक पकड़ते हैं। Director को screenshot के साथ exact text, contract, adjacent scenes और prop history मिलती है।
Background सही हो पर sprite हवा में हो तो MCP से position, scale, layer या crop बदलना recompose है। गलत pose background में बनी हो तो regenerate है। नया render फिर स्वतंत्र review से गुजरता है।
त्रुटि 1. नायक नायिका पर बैठ गया
Mobile crop में Gray की layer सोती Assol के ऊपर आ गई। “दोनों दिख रहे हैं” सच था, लेकिन पर्याप्त नहीं। अब हर viewport support, depth और body intersection जाँचता है।

त्रुटि 2. एक अंगूठी कई बन गई
सिर्फ सोने की वस्तु ढूँढने से अंगूठी हाथ और उंगली बदलती या कई बनती रही। Contract अब exactly one instance, निश्चित hand और finger, तथा transfer से पहले, दौरान और बाद की state माँगता है।

त्रुटि 3. पात्र text के उलट खिड़की की ओर देख रहे थे
सराय का shot सुंदर था, पर source कहता था कि पुरुष खिड़की की ओर पीठ करके बैठे थे। गलत orientation image में baked थी; placement से नहीं, regeneration से ठीक हो सकती थी।

चित्रों के ढेर से repeatable direction तक
पहले tests file, alpha, bounds और graph देखते थे। Reliability तब आई जब requirements exact text से निकलीं, Player controlling surface बना, review को adjacent scenes और prop history मिली, और हर failure को repair चुनकर स्वतंत्र rerun करना पड़ा।
यह सब अभी पूरी तरह automatic generation से बहुत दूर है। इंसान की visual समझ, अनुभव और भावनाएँ सफलता का मुख्य मापदंड हैं; मुझे नहीं लगता कि मैं जल्द ही generation को पूरी तरह autonomous कह पाऊँगा।
फिर भी मौजूदा pipeline मेरे कई घंटे बचाता है और आशा है कि दूसरे creators का समय भी बचाएगा। समय रचनात्मक काम के लिए रखें और कठिन technical routine scripts तथा AI को सौंपें। तभी text, HTML या PDF चित्रों के ढेर के बजाय एक coherent visual novel बनता है।