AI নির্দেশনা ও গুণমান
উৎস থেকে দৃশ্য: জেনারেট করা ভিজ্যুয়াল নভেলের কেন পরিচালক দরকার
একটি বা দুটি সুন্দর ছবি বানানো তুলনামূলক সহজ। দশটির পরে আসল সমস্যা শুরু হয়: চরিত্রকে একই মানুষ, স্থানকে একই জায়গা, prop-কে একই পরিচয় ও অবস্থায় থাকতে হবে; প্রতিটি frame-কে মূল লেখা ও আগের scene এগিয়ে নিতে হবে। আলাদা paragraph image model-এ পাঠালে illustrations-এর album হয়, কার্যকর visual novel নয়।
একটি সাহিত্যিক adaptation-এ চরিত্রের scale বদলেছে, মানুষ বাতাসে ঝুলেছে, একই উপকূল পরের shot-এ পাল্টেছে, music আবার শুরু হয়েছে এবং গুরুত্বপূর্ণ আংটি হাত, আঙুল বা সংখ্যা বদলেছে। তাই generation-কে text analyst, artist, compositor, MCP agent, technical validator ও AI director-সহ production pipeline করা হয়েছে।

1. ছবির আগে source স্থির হয়
Input হতে পারে text, HTML, Markdown বা text-based PDF। প্রথমে ভাষা, edition, chapter order এবং original, translation ও image-এর rights নথিভুক্ত হয়। romergo_inspect_story_source ও romergo_plan_story_source project না লিখে inventory ও preview তৈরি করে। Linear source-এ কল্পিত branch যোগ করা হয় না।
স্থান, সময়, অংশগ্রহণকারী বা action সত্যি বদলালে scene ভাগ হয়। প্রতিটি scene exact sourceExcerpt এবং visual contract রাখে: কে উপস্থিত, কে কথা বলে বা শোনে, কী করে, কোথায় তাকায়, শরীর কীসের ওপর ভর করে, mobile crop-এ কোন মুখ থাকতে হবে এবং কোন detail পাশের scene-এর সঙ্গে যুক্ত।
2. Character, location ও prop-এর স্মৃতি থাকে
একটি স্বাধীন text auditor অংশটি আবার পড়ে এবং ব্যবহার করা সব prop বের করে। প্রতিটি prop canonical description, অপরিবর্তনীয় traits, holder, state, visibility ও count পায়। সোনার আংটি transfer-এর আগে, সময়ে ও পরে একই একটি আংটি থাকতে হবে।
Scene map, character ও location bibles, prop ledger, asset manifest, generation jobs এবং audit reports stable ID ও source hash-এ যুক্ত। এগুলো বইয়ের বিকল্প নয়; agent-এর মধ্যে সিদ্ধান্ত হারাতে দেয় না।
3. Composition-এর দুই mode
baked_narrative direct dialogue ছাড়া narrative scene-এ character-কে background-এর মধ্যে আঁকে, ফলে মাটি, বিছানা, পাথর বা চেয়ারের support এক ছবিতেই স্বাভাবিক হয়। layered_dialogue কথোপকথনের জন্য background ও speaking/listening sprites আলাদা রাখে এবং সঠিক নাম ও portrait বজায় রাখে। Hybrid সম্ভব, কিন্তু স্পষ্ট সিদ্ধান্ত হতে হবে।
Generation exact excerpt, location bible ও current prop state থেকে শুরু হয়। File QA ভাঙা anatomy, transparency halo, কাটা silhouette, accidental text এবং repeated vegetation খোঁজে। তবুও একা PNG final staging যাচাই করতে পারে না।
4. MCP editable project গড়ে
Approved assets draft-এ যায়। MCP tools chapter, scene, text, transition, timeline, music ও placement তৈরি করে। Agent romergo_get_chapter দিয়ে saved state পড়ে, romergo_validate_project চালায় এবং romergo_verify_quest_change দিয়ে শেষ করে। Tool success persisted runtime-এর প্রমাণ নয়।
5. AI director text পড়ে এবং Player দেখে
Final review পুরো chapter desktop ও 390 × 844-এ চালায়। Scene entry-এর 0, 100 ও 500 ms screenshot black screen, white background বা পুরোনো sprite ধরে। Director screenshot-এর সঙ্গে exact text, contract, adjacent scenes ও prop history পায়।
Background সঠিক কিন্তু sprite বাতাসে থাকলে MCP দিয়ে position, scale, layer বা crop বদলানো recompose। ভুল pose background-এ আঁকা থাকলে regenerate। নতুন render আবার স্বাধীন review পায়।
ভুল 1. নায়ক নায়িকার ওপর বসেছে
Mobile crop-এ Gray-এর layer ঘুমন্ত Assol-এর ওপর পড়েছে। “দুজনকেই দেখা যায়” সত্য হলেও যথেষ্ট ছিল না। এখন প্রতিটি viewport support, depth ও body intersection দেখে।

ভুল 2. একটি আংটি অনেক হয়েছে
শুধু সোনালি বস্তু খোঁজায় আংটি হাত, আঙুল ও সংখ্যা বদলেছে। Contract এখন exactly one instance, নির্দিষ্ট hand ও finger, এবং transfer-এর আগে, সময়ে ও পরের state চায়।

ভুল 3. চরিত্ররা text-এর বিপরীতে জানালার দিকে তাকিয়েছে
সরাইখানার shot সুন্দর ছিল, কিন্তু source বলেছিল পুরুষরা জানালার দিকে পিঠ দিয়ে বসেছিল। ভুল orientation image-এর মধ্যে baked ছিল; layout নয়, regeneration দরকার ছিল।

ছবির স্তূপ থেকে repeatable direction
প্রথম tests শুধু file, alpha, bounds ও graph দেখত। Requirements exact text থেকে আসা, Player controlling surface হওয়া, review-এ adjacent scenes ও prop history যুক্ত হওয়া এবং প্রতিটি failure-এর repair ও independent rerun বাধ্যতামূলক হওয়ার পর reliability এসেছে।
এই সবকিছু এখনও পুরো automatic generation থেকে অনেক দূরে। মানুষের visual experience, পেশাগত জ্ঞান ও অনুভূতিই সাফল্যের প্রধান মানদণ্ড; শিগগির generation-কে সম্পূর্ণ autonomous বলতে পারব বলে মনে করি না।
তবু বর্তমান pipeline ইতিমধ্যে আমার অনেক ঘণ্টা বাঁচায় এবং আশা করি অন্য creators-এর সময়ও বাঁচাবে। সৃজনশীল কাজের জন্য সময় রাখুন, জটিল technical routine scripts ও AI-কে দিন। এভাবেই text, HTML বা PDF ছবির সংগ্রহ নয়, একটি coherent visual novel হয়।