AI ہدایت کاری اور معیار

ماخذ سے منظر تک: تیار کردہ بصری ناول کو ہدایت کار کیوں چاہیے

ایک یا دو خوبصورت تصویریں بنانا نسبتاً آسان ہے۔ اصل مشکل دسویں تصویر کے بعد شروع ہوتی ہے: کردار وہی شخص رہے، جگہ وہی رہے، prop کی شناخت اور حالت قائم رہے، اور ہر frame متن اور پچھلے scene کو آگے بڑھائے۔ الگ الگ پیراگراف image model کو دینے سے illustrations کا album بنتا ہے، کام کرنے والا visual novel نہیں۔

ایک ادبی adaptation میں کرداروں کا scale بدلا، لوگ ہوا میں لٹکے، وہی ساحل اگلے shot میں بدل گیا، music دوبارہ شروع ہوا اور اہم انگوٹھی ہاتھ، انگلی یا تعداد بدلتی رہی۔ اسی لیے generation ایک pipeline بن گئی جس میں text analyst، artist، compositor، MCP agent، technical validator اور AI director شامل ہیں۔

![Romergo flow جو source، story structure اور continuity bibles سے assets، MCP assembly اور director review تک جاتا ہے](direction-flow)

1. تصویر سے پہلے ماخذ طے ہوتا ہے

Input text، HTML، Markdown یا text-based PDF ہو سکتا ہے۔ پہلے زبان، edition، chapter order اور اصل، ترجمے اور تصاویر کے حقوق درج ہوتے ہیں۔ romergo_inspect_story_source اور romergo_plan_story_source project لکھے بغیر inventory اور preview بناتے ہیں۔ Linear source میں خود سے branches شامل نہیں کی جاتیں۔

جگہ، وقت، کردار یا action حقیقت میں بدلے تو scene تقسیم ہوتا ہے۔ ہر scene exact sourceExcerpt اور visual contract رکھتا ہے: کون موجود ہے، کون بول یا سن رہا ہے، کیا کر رہا ہے، کہاں دیکھ رہا ہے، جسم کس support پر ہے، mobile crop میں کون سا چہرہ بچنا چاہیے اور کون سی detail ساتھ والے scenes کو جوڑتی ہے۔

2. کرداروں، جگہوں اور props کی یادداشت ہوتی ہے

ایک آزاد text auditor اقتباس دوبارہ پڑھ کر ہر interact ہونے والا prop نکالتا ہے۔ ہر prop کو canonical description، مستقل traits، holder، state، visibility اور count ملتا ہے۔ سنہری انگوٹھی transfer سے پہلے، دوران اور بعد وہی ایک انگوٹھی رہنی چاہیے۔

Scene map، character اور location bibles، prop ledger، asset manifest، generation jobs اور audit reports stable IDs اور source hash سے جڑے ہوتے ہیں۔ یہ کتاب کی جگہ نہیں لیتے؛ agents کے درمیان فیصلے گم ہونے سے بچاتے ہیں۔

3. Composition کے دو modes

baked_narrative direct dialogue کے بغیر narrative scene میں کردار کو background کے اندر بناتا ہے تاکہ زمین، بستر، پتھر یا کرسی کا support قدرتی ہو۔ layered_dialogue گفتگو کے لیے background اور speaking/listening sprites الگ رکھتا اور درست نام و portrait دکھاتا ہے۔ Hybrid ممکن ہے مگر واضح فیصلہ ہونا چاہیے۔

Generation exact excerpt، location bible اور current prop state سے شروع ہوتی ہے۔ File QA خراب anatomy، transparency halo، کٹی silhouette، حادثاتی text اور repeated vegetation دیکھتا ہے۔ لیکن اکیلا PNG final staging ثابت نہیں کرتا۔

4. MCP editable project جوڑتا ہے

Approved assets draft میں جاتے ہیں۔ MCP tools chapters، scenes، text، transitions، timeline، music اور placement بناتے ہیں۔ Agent romergo_get_chapter سے saved state پڑھتا، romergo_validate_project چلاتا اور romergo_verify_quest_change سے مکمل کرتا ہے۔ Tool success persisted runtime کا ثبوت نہیں۔

5. AI director متن بھی پڑھتا اور Player بھی دیکھتا ہے

Final review پورا chapter desktop اور 390 × 844 پر چلاتا ہے۔ Scene entry کے 0، 100 اور 500 ms screenshots black screen، white background یا پرانا sprite پکڑتے ہیں۔ Director کو screenshot کے ساتھ exact text، contract، adjacent scenes اور prop history ملتی ہے۔

Background درست ہو مگر sprite ہوا میں ہو تو MCP سے position، scale، layer یا crop بدلنا recompose ہے۔ غلط pose background میں بنی ہو تو regenerate ہے۔ نیا render دوبارہ آزاد review سے گزرتا ہے۔

غلطی 1. ہیرو ہیروئن پر بیٹھ گیا

Mobile crop میں Gray کی layer سوئی ہوئی Assol کے اوپر آگئی۔ “دونوں کردار نظر آتے ہیں” درست مگر ناکافی تھا۔ اب ہر viewport support، depth اور body intersection دیکھتا ہے۔

![Mobile frame جہاں Gray سوئی ہوئی Assol پر overlap کرتا ہے](direction-failure-overlap)

غلطی 2. ایک انگوٹھی کئی بن گئی

صرف سنہری چیز دیکھنے سے انگوٹھی نے ہاتھ، انگلی اور تعداد بدلی۔ Contract اب exactly one instance، مقرر hand اور finger، اور transfer سے پہلے، دوران اور بعد states مانگتا ہے۔

![انگوٹھی کی غلط جگہ والی نو تراشیں: انگلی سے ہٹی ہوئی، ساتھ معلق یا غلط انگلی پر](direction-failure-ring)

غلطی 3. کردار متن کے برخلاف کھڑکی کی طرف دیکھ رہے تھے

سرائے کا shot خوبصورت تھا، مگر source کہتا تھا کہ مرد کھڑکی کی طرف پیٹھ کرکے بیٹھے تھے۔ غلط orientation image میں baked تھی؛ layout سے نہیں، regeneration سے درست ہوتی۔

![سرائے کا scene جہاں کردار source instruction کے خلاف کھڑکی دیکھتے ہیں](direction-failure-window)

تصویروں کے ڈھیر سے repeatable direction تک

ابتدائی tests صرف file، alpha، bounds اور graph دیکھتے تھے۔ Reliability تب آئی جب requirements exact text سے نکلیں، Player controlling surface بنا، review کو adjacent scenes اور prop history ملی، اور ہر failure کو repair چن کر independent rerun کرنا پڑا۔

یہ سب اب بھی مکمل automatic generation سے بہت دور ہے۔ انسانی visual understanding، تجربہ اور احساس کامیابی کا بنیادی معیار ہیں؛ مجھے نہیں لگتا کہ میں جلد generation کو مکمل autonomous کہہ سکوں گا۔

اس کے باوجود موجودہ pipeline میرے کئی گھنٹے بچاتا ہے اور امید ہے دوسرے creators کا وقت بھی بچائے گا۔ وقت تخلیقی کام کے لیے رکھیں اور پیچیدہ technical routine scripts اور AI کو سونپیں۔ یوں text، HTML یا PDF تصویروں کے مجموعے کے بجائے ایک مربوط visual novel بنتا ہے۔

ڈیولپمنٹ بلاگ پر واپس جائیں