এআই পরীক্ষা
আমি আমার এআই এজেন্টকে রোমারগোতে আমন্ত্রণ জানিয়েছি এবং আমি জানি না এটি কী বা এটিকে কী বলা উচিত।
অ্যাপ্লিকেশনগুলিতে বেশিরভাগ AI ইন্টিগ্রেশনগুলি একটি অনুমানযোগ্য উপায়ে ডিজাইন করা হয়েছে। পণ্যটি একটি স্পার্ক বোতাম যোগ করে, তার নিজস্ব মডেলে একটি অনুরোধ পাঠায় এবং সাইডবারে প্রতিক্রিয়া প্রদর্শন করে।
আরেকটি সাধারণ বিকল্প আছে। অ্যাপ্লিকেশনটি একটি MCP সার্ভার সরবরাহ করে এবং ব্যবহারকারী ChatGPT, Claude বা অন্য এজেন্ট খোলে এবং এটিকে অ্যাপ্লিকেশন ডেটার সাথে কাজ করতে বলে। এটি এজেন্টকে ভাল সরঞ্জাম দেয়, কিন্তু কথোপকথন অন্য কোথাও ঘটে। আপনাকে সম্পাদক ছেড়ে যেতে হবে, বর্তমানে কী খোলা আছে তা ব্যাখ্যা করতে হবে, ফিরে যেতে হবে এবং ফলাফল পরীক্ষা করতে হবে।
আমি চ্যাট এবং সম্পাদকের মধ্যে পরিবর্তন করতে করতে ক্লান্ত হয়ে পড়েছিলাম, এবং আমার কাছে একটি ধারণা এসেছিল: আমি যদি এটি পুরোপুরি এড়াতে পারি?
আমি সরাসরি সম্পাদকের সাথে একটি AI প্যানেল যোগ করেছি, কিন্তু Romergo দ্বারা হোস্ট করা একটি মডেলের সাথে এটি সংযুক্ত করিনি। পরিবর্তে, ব্যবহারকারী তাদের ব্যক্তিগত এআই এজেন্টকে খোলা সেশনে আমন্ত্রণ জানায়।
এজেন্ট যেখানেই থাকে সেখানেই থাকে: ChatGPT, Claude, Codex, বা অন্য MCP- সামঞ্জস্যপূর্ণ ক্লায়েন্টে। এটি তার মডেল, সদস্যতা, মেমরি, সেটিংস এবং উপলব্ধ সরঞ্জাম রাখে। Romergo একটি প্রকল্প সম্পাদনা করার জন্য শুধুমাত্র একটি কর্মক্ষেত্র, বর্তমান প্রসঙ্গ এবং বিশেষ সরঞ্জাম প্রদান করে।
সংযোগ করার পরে, ব্যবহারকারী বিল্ডার থেকে সরাসরি এজেন্টকে লিখতে পারেন:
- খোলা দৃশ্য বর্ণনা করুন;
- এই অধ্যায়ে সঙ্গীত পরিবর্তন;
- হাইলাইট করা সংলাপ পুনরায় লিখুন;
- একটি ভিন্ন পটভূমি রাখুন;
- রূপান্তর যুক্তি পরীক্ষা করুন;
- ব্যাখ্যা করুন কেন দৃশ্যটি আমার প্রত্যাশা অনুযায়ী কাজ করে না।
উত্তর, প্রশ্ন এবং মধ্যবর্তী অবস্থা একই প্যানেলে ফেরত দেওয়া হয়। প্যানেলটি কেবল পাঠ্যই নয়, পুরো টাস্ক চক্রটিও দেখায়: একটি কমান্ড প্রাপ্ত হয়েছে, একটি এজেন্টকে বরাদ্দ করা হয়েছে, সরঞ্জামগুলি কার্যকর করা হচ্ছে, নিশ্চিতকরণ প্রয়োজন, কাজটি সম্পূর্ণ হয়েছে বা একটি ত্রুটি ঘটেছে৷ আপনাকে আর সম্পাদক ছেড়ে যেতে হবে না।
এটি একটি পরীক্ষা হিসাবে শুরু হয়েছিল
আমার একটি নতুন প্রোটোকল উদ্ভাবন বা একটি নতুন পণ্য বিভাগ নিয়ে আসার কোন উদ্দেশ্য ছিল না। আমি একটি সাধারণ ধারণা পরীক্ষা করতে চেয়েছিলাম: একজন ব্যক্তিগত ব্যবহারকারী এজেন্ট কি কেবল এমসিপির মাধ্যমে রোমারগোকে বাহ্যিকভাবে নিয়ন্ত্রণ করতে পারে না, তবে সাময়িকভাবে সম্পাদকের ভিতরে একটি লাইভ সেশনে যোগ দিতে পারে?
প্রথম সংস্করণ একটি পরীক্ষা ছিল. আমার আশ্চর্যের জন্য, এটি আমার নিজের ব্যবহার শুরু করার জন্য যথেষ্ট ভাল কাজ করেছে।
সংক্ষিপ্ততম চিত্রটি এভাবে আঁকা যেতে পারে:
Personal AI agent <-> MCP <-> Romergo Builder
তবে উভয় দিকের চিহ্নটি গুরুত্বপূর্ণ।
একটি সাধারণ MCP কল এজেন্টে শুরু হয়: এজেন্ট অ্যাপ্লিকেশনটির সাথে যোগাযোগ করার সিদ্ধান্ত নেয় এবং তার টুলকে কল করে। আমার পরীক্ষায়, রোমারগোও কাজ শুরু করতে পারে। ব্যবহারকারী বিল্ডারে একটি কমান্ড লেখেন, রোমার্গো এটিকে একটি সুরক্ষিত চ্যানেলে রাখে এবং ইতিমধ্যে সংযুক্ত এজেন্ট এমসিপির মাধ্যমে কমান্ডটি গ্রহণ করে।
তারপরে এজেন্ট প্রজেক্টটি পড়তে বা পরিবর্তন করতে সাধারন রোমার্গো টুল ব্যবহার করে এবং একই চ্যানেলের মাধ্যমে বিল্ডারকে ফলাফল ফেরত দেয়।
এটি একটি বন্ধ লুপ তৈরি করে:
1. User -> Builder panel: "Replace the music in this chapter"
2. Builder -> authenticated channel: command + current page + selection
3. Personal agent -> MCP: wait for the next Builder command
4. Agent -> Romergo MCP tools: inspect and edit the project
5. Agent -> MCP channel: status, question, result, or error
6. Builder panel -> User: live response from the personal agent
রোমার্গো এই ধাপগুলোর কোনোটিতেই মডেলটি চালায় না।
একই সময়ে, আমি নিজে MCP পরিবর্তন করিনি এবং এতে একটি বাস্তব সার্ভার পুশ যোগ করিনি। প্রোটোকলের দৃষ্টিকোণ থেকে, সমস্ত কল এখনও এজেন্ট দ্বারা শুরু হয়। বিপরীত দিকটি একটি সুরক্ষিত মেলবক্স হিসাবে প্রয়োগ করা হয়: নির্মাতা চ্যানেলে কমান্ড লেখেন এবং এজেন্ট সাধারণ লং-পোল MCP টুলের মাধ্যমে এটির জন্য অপেক্ষা করে। তারপর এজেন্ট একই স্বাভাবিক টুল কল ব্যবহার করে ইভেন্টটি ফেরত পাঠায়।
দ্বিমুখী আচরণ অ্যাপ্লিকেশন-সেশন স্তরে প্রদর্শিত হয়, একটি নতুন MCP পরিবহনের মাধ্যমে নয়। এই পার্থক্যটি গুরুত্বপূর্ণ: বর্তমান বাস্তবায়নটি স্ট্যান্ডার্ড MCP কলগুলির উপরে নির্মিত একটি ছোট সেশন চুক্তি হিসাবে ভালভাবে বোঝা যায়।
কিভাবে একজন এজেন্ট একটি সেশনে প্রবেশ করে
নির্মাতা একটি অস্থায়ী চ্যানেল কোড তৈরি করে। ব্যবহারকারী তাদের এআই চ্যাটে একটি সংক্ষিপ্ত প্রারম্ভিক প্রম্পট অনুলিপি করে এরকম কিছু দিয়ে:
আমার রোমেরগো বিল্ডার চ্যানেলে যোগ দিন। প্রতিটি নতুন কমান্ড একবার চালান, ফলাফল বা প্রশ্ন বিল্ডারকে ফেরত পাঠান, এবং যতক্ষণ না আমি স্পষ্টভাবে আপনাকে থামাতে বলি ততক্ষণ অপেক্ষা করতে থাকুন।
এজেন্ট তখন MCP টুল romergo_join_builder_channel কল করে এবং কোডটি পাস করে। এটি একটি হ্যান্ডশেক: Romergo OAuth সেশন, চ্যানেলের মালিক এবং এর মেয়াদ শেষ হওয়ার তারিখ পরীক্ষা করে এবং তারপর কথোপকথনের অবস্থা এবং শেষ কমান্ড কার্সারটি ফেরত দেয়।
এরপরে, এজেন্ট romergo_wait_for_builder_command কল করে। এটি একটি দীর্ঘ ভোট যা সম্পাদকের পরবর্তী কমান্ডের জন্য অপেক্ষা করে। যদি কিছু না আসে, এজেন্ট কার্সারটি সংরক্ষণ করে এবং আবার অপেক্ষা করা শুরু করে। যদি কমান্ডটি বিদ্যমান থাকে তবে এতে রয়েছে:
- নির্দেশ পাঠ্য;
- কমান্ড আইডি;
- একঘেয়ে ক্রম;
- বিল্ডার বর্তমান পথ;
- খোলা প্রকল্পের আইডি, অধ্যায় এবং দৃশ্য, যখন সেগুলি URL-এ থাকে;
- সম্পাদক পৃষ্ঠের ধরন এবং প্রসঙ্গ ক্যাপচার সময়;
- ব্যবহারকারী-নির্বাচিত পাঠ্য, যদি থাকে।
সমস্ত সংযুক্ত প্রসঙ্গ অবিশ্বস্ত অ্যাপ্লিকেশন সামগ্রী হিসাবে চিহ্নিত করা হয়েছে৷ এটি কাজের জন্য ডেটা, এবং এজেন্টের নিয়ন্ত্রণ নির্দেশের ধারাবাহিকতা নয়।
এজেন্ট বিদ্যমান Romergo MCP টুল ব্যবহার করে কাজটি সম্পাদন করে। উদাহরণস্বরূপ, এটি প্রকল্প এবং অধ্যায় পড়তে পারে, সম্পদ খুঁজে বের করতে পারে, দৃশ্য পরিবর্তন করতে পারে এবং তারপরে সংরক্ষিত ফলাফল যাচাই করতে পারে।
এটি কাজ করার সময়, এজেন্ট romergo_report_builder_event কল করে প্যানেল পাঠাতে পারে:
status- সংক্ষিপ্ত মধ্যবর্তী অবস্থা;question- একটি প্রশ্ন যার উত্তর ছাড়া এটি চালিয়ে যাওয়া নিরাপদ নয়;reply— সমাপ্ত ফলাফল;error- ত্রুটির একটি স্পষ্ট বর্ণনা।
প্রতিক্রিয়াটি commandId-এ আবদ্ধ, এবং পরবর্তী কমান্ডটি শেষ প্রক্রিয়াকৃত ক্রম থেকে পড়া হয়। যখন প্রথম ইস্যু করা হয়, তখন API পারমাণবিকভাবে client_id OAuth ক্লায়েন্টকে কমান্ড বরাদ্দ করে। অন্য সংযুক্ত এজেন্ট একই সময়ে একই কাজ নিতে সক্ষম হবে না। কার্সার একটি টাইমআউট বা পুনঃসংযোগের পরে চালিয়ে যেতে সাহায্য করে এবং নির্দিষ্ট টুল কলের এক-কালীন নিশ্চিতকরণ একটি আর্গুমেন্ট ফিঙ্গারপ্রিন্ট দ্বারা সুরক্ষিত থাকে এবং অন্য কাজের জন্য পুনরায় ব্যবহার করা যায় না।
অধিকার ঘরের অন্তর্গত, প্রম্পট নয়
সংযোগ করার আগে, ব্যবহারকারী চ্যানেল সেটিংস দেখে এবং এজেন্টকে কী করার অনুমতি দেওয়া হয়েছে তা নির্বাচন করে: প্রকল্পটি পড়ুন, বিষয়বস্তু সম্পাদনা করুন, মিডিয়া এবং অডিওর সাথে কাজ করুন, ডেটা প্রকাশ করুন বা মুছুন৷ এই সেটিংস প্যানেল হেডারে গিয়ারের মাধ্যমে যেকোনো সময় খোলা যেতে পারে।
ডিফল্টরূপে, পড়া, সম্পাদনা, এবং মিডিয়ার সাথে কাজ করা উপলব্ধ, এবং ব্যবহারকারীর কাছ থেকে একটি সরাসরি অনুরোধ ইতিমধ্যেই এই ক্রিয়াগুলি প্রয়োগ করার অনুমতি হিসাবে বিবেচিত হয়৷ প্রকাশনা এবং মুছে ফেলা নিষ্ক্রিয় এবং পৃথকভাবে সক্রিয় করা হয়. যদি ইচ্ছা হয়, ব্যবহারকারী একটি কঠোর মোড সক্ষম করতে পারেন এবং প্রতিটি পরিবর্তন আবার নিশ্চিত করতে পারেন, অথবা শুধুমাত্র প্রকাশ এবং মুছে ফেলার জন্য নিশ্চিতকরণের প্রয়োজন হয়৷
এটি শুধুমাত্র স্টার্ট প্রম্পটে পাঠ্য নয়। সাধারণ সার্ভার র্যাপার পরিবর্তনকারী MCP টুল কল করার আগে সুযোগ পরীক্ষা করে। অতিরিক্ত নিশ্চিতকরণ সক্ষম হলে, বিল্ডার "একবার অনুমতি দিন" এবং "প্রত্যাখ্যান করুন" বোতামগুলির সাথে সঠিক ক্রিয়া দেখায়, যখন আসল কলটি একটি সিদ্ধান্তের জন্য অপেক্ষা করতে থাকে। অনুমতিটি কমান্ড, টুল এবং আর্গুমেন্ট ফিঙ্গারপ্রিন্টের সাথে আবদ্ধ এবং একবার কার্যকর করা হলে এটি আর বৈধ থাকে না।
প্রতিটি পরিবর্তনকারী টুলের শুরু, সমাপ্তি, ত্রুটি এবং ব্লকিং স্বয়ংক্রিয়ভাবে প্যানেলে ফিরে আসে। প্রতিটি চূড়ান্ত উত্তরে একটি স্থিতি এবং ফলাফলের একটি নির্দিষ্ট বিবরণ সহ একটি কাঠামোগত সারাংশ থাকতে হবে। পরিবর্তনের পরে, এজেন্ট পরিবর্তিত সত্ত্বা, সম্পাদিত চেক এবং ফলাফলের লিঙ্কগুলিও তালিকাভুক্ত করে; বিল্ডার প্রতিক্রিয়া পাঠ্যের নীচে সরাসরি এই সারাংশ প্রদর্শন করে। চ্যানেলটি সেটিংস থেকে স্পষ্টভাবে বন্ধ করা যেতে পারে; পুরানো কোড অবিলম্বে কাজ করা বন্ধ করে দেয়।
রোমেরগোতে কী আছে এবং ব্যবহারকারীর কাছে কী থাকে
আমি এই স্থাপত্যটিকে উদ্বেগের বিচ্ছেদ হিসাবে ভাবতে পছন্দ করি।
Romergo প্রদান করে:
- সম্পাদক এবং চাক্ষুষ কর্মক্ষেত্র;
- বর্তমান প্রকল্প, পৃষ্ঠা এবং নির্বাচন;
- দ্বিমুখী যোগাযোগের জন্য অস্থায়ী ঘর;
- একটি প্রকল্প পড়া, পরিবর্তন এবং পরীক্ষা করার জন্য ডোমেন-নির্দিষ্ট সরঞ্জাম;
- OAuth, অ্যাক্সেস অধিকার এবং সেশন ইভেন্ট ইতিহাস;
- একটি ইন্টারফেস যেখানে ব্যবহারকারী প্রশ্ন, অগ্রগতি এবং ফলাফল দেখে।
ব্যবহারকারী এজেন্ট নিয়ে আসে:
- মডেল এবং গণনা;
- নিজস্ব সদস্যতা;
- যুক্তি এবং পরিকল্পনা;
- মেমরি এবং ব্যক্তিগতকরণ, যদি নির্বাচিত এজেন্ট দ্বারা প্রদান করা হয়;
- অন্যান্য সংযুক্ত সরঞ্জাম;
- কাজের স্টাইল ব্যবহারকারীর কাছে পরিচিত।
বুদ্ধিমত্তা অ্যাপ্লিকেশনের অন্তর্গত নয়। অ্যাপটি এমন একটি জায়গা তৈরি করে যেখানে এই বুদ্ধিমত্তা নিরাপদে কাজ করতে পারে।
কেন একটি নিয়মিত বিল্ট-ইন copilot না
অন্তর্নির্মিত AI ব্যাখ্যা করা সহজ এবং সক্ষম করা সহজ হবে। ব্যবহারকারী একটি বোতাম টিপে, অ্যাপ্লিকেশনটি নির্বাচিত মডেলটিকে কল করে, সবকিছু কাজ করে।
কিন্তু তারপর রোমার্গোকেও এআই পরিকাঠামোর একজন অপারেটর হতে হবে:
- অনুমানের জন্য অর্থ প্রদান করুন বা একটি পরিকল্পনার মাধ্যমে এর খরচ পাস করুন;
- ব্যবহারকারীর জন্য মডেল নির্বাচন করুন;
- নিজস্ব মেমরি এবং ব্যক্তিগতকরণ তৈরি করুন;
- বাহ্যিক পরিষেবাগুলি পুনরায় সংযোগ করুন;
- অতিরিক্ত সংবেদনশীল প্রসঙ্গ সংরক্ষণ করুন;
- ক্রমাগত অনুভূমিক AI পণ্যের ক্ষমতা সঙ্গে ধরা.
একটি ব্যক্তিগত এজেন্ট ব্যবহার করার সময়, এই সব ইতিমধ্যে ব্যবহারকারীর পাশে বিদ্যমান. Romergo অন্য ChatGPT তৈরি করার চেষ্টা করছে না। এটি ChatGPT, Claude বা অন্য এজেন্টকে একটি বিশেষ ওয়ার্কস্পেস এবং পরিষ্কার টুল দেয়।
এটি একটি সৃজনশীল সম্পাদকের জন্য বিশেষভাবে আকর্ষণীয়। একই এজেন্ট জানতে পারে কিভাবে ব্যবহারকারী কথোপকথন লেখেন, তারা কোন টোন পছন্দ করেন, কোন রেফারেন্স ইতিমধ্যে আলোচনা করা হয়েছে এবং কোন বাহ্যিক সরঞ্জাম তারা ব্যবহার করেন। Romergo শুধুমাত্র একটি পটভূমি প্রতিস্থাপন বা একটি দৃশ্য পুনর্বিন্যাস সাহায্য করার জন্য এই সম্পূর্ণ সিস্টেম অনুলিপি করতে হবে না.
অদ্ভুত অংশ: এজেন্ট বাইরে এবং ভিতরে উভয়ই
এজেন্ট শারীরিকভাবে রোমার্গোর কাছে যায় না। এর মডেল এবং এজেন্ট লুপ আসল এআই ক্লায়েন্টে চলতে থাকে।
কিন্তু ব্যবহারকারীর দৃষ্টিকোণ থেকে, এজেন্ট সম্পাদকের ভিতরে উপস্থিত রয়েছে:
- অন্তর্নির্মিত প্যানেল থেকে কমান্ড গ্রহণ করে;
- ব্যবহারকারী কোন পৃষ্ঠায় আছেন তা জানেন;
- সংযুক্ত নির্বাচন দেখে;
- একই প্রকল্প পরিবর্তন;
- প্রশ্ন জিজ্ঞাসা করে এবং একই প্যানেলে উত্তর দেয়;
- পৃষ্ঠাগুলি স্যুইচ করার পরে বা পুনরায় সংযোগ করার পরে কথোপকথন চালিয়ে যেতে পারেন।
অতএব, "অ্যাপ্লিকেশনের ভিতরে AI" এবং "MCP এর মাধ্যমে AI বাইরে" অভিব্যক্তি দুটিই এখানে সম্পূর্ণরূপে সঠিক নয়। এটি বরং আবেদন সেশনে একটি বহিরাগত এজেন্টের একটি অস্থায়ী উপস্থিতি।
আমি এই দিকে অগ্রসর হওয়া প্রথম নই
পরীক্ষাটি কাজ করার পরে, আমি অনুরূপ পদ্ধতির সন্ধান করতে শুরু করি।
এজেন্ট ক্লায়েন্ট প্রোটোকল Zed এবং JetBrains-এর মত সম্পাদকদেরকে বাহ্যিক কোডিং এজেন্ট সংযোগ করতে দেয়। Tidewave চলমান ওয়েব অ্যাপ্লিকেশনের পাশে Claude Code, Codex এবং অন্যান্য ACP এজেন্ট রাখে এবং তাদের ব্রাউজার এবং রানটাইম প্রসঙ্গ পাস করে। অবসিডিয়ান এজেন্ট ক্লায়েন্ট নোটের ঠিক পাশে ক্লদ কোড, কোডেক্স এবং জেমিনি দেখায় এবং স্বয়ংক্রিয়ভাবে সক্রিয় নথি এবং নির্বাচন সংযুক্ত করে। marimo বহিরাগত এজেন্টকে একটি শেয়ার্ড ওয়ার্কস্পেস হিসাবে একটি লাইভ নোটবুক দেয়৷
এছাড়াও আরো সাধারণ পরীক্ষা আছে. AG-UI ব্যবহারকারী ইন্টারফেস এবং এজেন্ট ব্যাকএন্ডের মধ্যে দ্বি-মুখী যোগাযোগের মানসম্মত করে। WebMCP প্রস্তাব করে যে ওয়েব পৃষ্ঠাগুলি একটি সংযুক্ত ব্রাউজার বা ডেস্কটপ এজেন্টের কাছে উপলব্ধ সরঞ্জামগুলি নিবন্ধন করে৷ এজেন্ট অ্যাপ্লিকেশন প্রোটোকল এমন একটি মডেল বর্ণনা করে যেখানে অ্যাপ্লিকেশনটি UI এবং ডোমেন সরঞ্জামগুলির মালিক এবং বহিরাগত এজেন্ট যুক্তি, ইতিহাস এবং সাধারণ-উদ্দেশ্য সরঞ্জামগুলির মালিক৷
অর্থাৎ, মৌলিক ধারণাটি ইতিমধ্যে বেশ কয়েকটি আকারে বিদ্যমান। কিন্তু বেশিরভাগ বাস্তবায়ন আইডিই, স্থানীয় কোডিং এজেন্ট বা কোম্পানি নিজেই মোতায়েন করা এজেন্টের উপর ফোকাস করে।
রোমার্গো পরীক্ষাটি আমার কাছে একটি সামান্য ভিন্ন প্রশ্নের কারণে আকর্ষণীয়: যদি একজন ব্যক্তিগত ব্যবহারকারী এজেন্ট একটি নিয়মিত সৃজনশীল অ্যাপ্লিকেশনে প্রবেশ করতে পারে তবে কী হবে?
নতুন মডেল নয়। মডেলের একটি API কী নয়। একটি অন্তর্নির্মিত copilot অ্যাপ্লিকেশন নয়. একটি এজেন্ট যা একজন ব্যক্তি ইতিমধ্যে প্রতিদিন ব্যবহার করে।
সুবিধা মাত্র অর্ধেক সমস্যা
একবার একজন বহিরাগত এজেন্ট অ্যাপ্লিকেশন কমান্ড শুনতে এবং একটি প্রকল্প পরিবর্তন করতে পারলে, নিরাপত্তা আর একটি ঐচ্ছিক বৈশিষ্ট্য নয়।
প্রশ্ন উত্থাপিত হয় যেগুলির উত্তর একটি OAuth স্ক্রীন দিয়ে দেওয়া যায় না:
- কোন পৃষ্ঠা এবং সত্তা একটি নির্দিষ্ট রুমে উপলব্ধ;
- নিশ্চিতকরণ ছাড়া কি কর্ম অনুমোদিত;
- প্রজেক্ট টেক্সটে কি প্রম্পট ইনজেকশন থাকতে পারে;
- কীভাবে একজন এজেন্টকে অবিশ্বস্ত ডেটা থেকে ব্যবহারকারীর কমান্ডকে আলাদা করতে হবে;
- টাইমআউটের পরে কমান্ডের কি হবে;
- কিভাবে ব্যবহারকারীর প্রকৃত পরিবর্তন দেখাবেন, এবং শুধুমাত্র একটি আত্মবিশ্বাসী পাঠ্য উত্তর নয়;
- কীভাবে একটি সেশন প্রত্যাহার করবেন এবং প্রমাণ করবেন যে এজেন্ট সত্যিই শোনা বন্ধ করেছে;
- ব্যক্তিগত এজেন্টের মেমরি এবং বাহ্যিক সংযোগের কোন অংশ একটি নির্দিষ্ট অ্যাপ্লিকেশনে ব্যবহার করার জন্য গ্রহণযোগ্য।
বর্তমান সংস্করণটি ব্যবহারকারী এবং সময় অনুসারে চ্যানেলকে সীমাবদ্ধ করে, OAuth ব্যবহার করে, সার্ভারের সুযোগ, এককালীন নিশ্চিতকরণ, পারমাণবিক কমান্ড দাবি এবং একটি সুস্পষ্ট জীবনচক্র। এটি এখনও একটি পরীক্ষা, কিন্তু গুরুত্বপূর্ণ সীমানাগুলি এখন কার্য সম্পাদনের অংশ এবং শুধুমাত্র এজেন্টের জন্য নির্দেশিকা নয়।
এটাকে কি বলে
আমার কাছে এখনও চূড়ান্ত শিরোনাম নেই।
আপনার নিজের AI আনুন সাধারণত আপনার নিজস্ব API কী বা মডেল নির্বাচন। আপনার নিজের এজেন্টকে আনুন কাছাকাছি কারণ ব্যবহারকারী শুধুমাত্র মডেল নয়, মেমরি, সরঞ্জাম এবং একটি এজেন্ট লুপও নিয়ে আসে। যাইহোক, BYOA পরীক্ষার একটি গুরুত্বপূর্ণ অংশ বর্ণনা করে না: অ্যাপ্লিকেশনটি এজেন্টের সাথে যোগাযোগ করতে পারে এবং এটির সাথে একটি লাইভ সেশন বজায় রাখতে পারে।
সম্ভবত এটি হল:
- একটি লাইভ এজেন্ট চ্যানেল;
- একটি অ্যাপ্লিকেশন-এজেন্ট সেশন;
- একটি এজেন্ট উপস্থিতি স্তর;
- একটি ব্যক্তিগত এজেন্ট সেতু;
- দ্বিমুখী MCP;
- বা বিদ্যমান ধারণাগুলির উপরে শুধুমাত্র একটি সফল পরীক্ষা।
আমি শুধু নামের জন্য একটি নতুন মান নিয়ে আসতে চাই না। প্রথমত, এই ধরনের একটি মডেল রোমার্গোর বাইরে উপযোগী কিনা এবং এটিকে বিশ্বাস করার জন্য কোন সীমার প্রয়োজন তা বোঝা আমার জন্য আরও গুরুত্বপূর্ণ।
অ্যাপ্লিকেশনের নেটিভ এআই প্রয়োজন নাও হতে পারে
আজ, প্রায় প্রতিটি পণ্য তার নিজস্ব সহকারী তৈরি করার চেষ্টা করে। ফলস্বরূপ, ব্যবহারকারীর অনেকগুলি পৃথক এআই রয়েছে: একটি সম্পাদকে, অন্যটি মেলে, তৃতীয়টি টাস্ক সিস্টেমে। প্রত্যেকের নিজস্ব সংক্ষিপ্ত স্মৃতি, নিজস্ব সীমাবদ্ধতা এবং নিজস্ব মূল্য রয়েছে।
আরেকটি সম্ভাব্য মডেল আছে।
অ্যাপটি একটি ওয়ার্কস্পেস, লাইভ প্রসঙ্গ এবং বিশেষ সরঞ্জাম সরবরাহ করে। ব্যবহারকারী একটি এজেন্ট নিয়ে আসে যা তারা ইতিমধ্যে বিশ্বাস করে। কাজ করার সময়, এজেন্ট অ্যাপ্লিকেশনটিতে যোগদান করে, কাজটি সম্পূর্ণ করতে সহায়তা করে এবং ব্যবহারকারীর সাথে চলে যায়।
আমি এখনও জানি না এটি একটি স্বাধীন স্থাপত্য বিভাগে পরিণত হবে কিনা। কিন্তু এখন আমি জানি যে এই ধরনের একটি চক্র একত্রিত করা যেতে পারে এবং এটি আসলে ব্যবহার করা যেতে পারে।
কিন্তু আমি জানি যে পরীক্ষা করা অনেক মজার।