6.7

View in English

6.7 AI এজেন্ট ও এজেন্টিক সিস্টেম

পরিচিতি ও প্রেরণা

একটি AI এজেন্ট হলো একটি লুপে মোড়া একটি বড় ভাষা মডেল (LLM): তাকে একটি লক্ষ্য দেওয়া হয়, সে টুল কল করতে পারে, সে যা করেছে তার কিছু স্মৃতি রাখে, এবং লক্ষ্য পূরণ বা সে হাল ছাড়া পর্যন্ত নিজের পরবর্তী ধাপ নিজে ঠিক করে। সেই লুপই একটি এজেন্ট ও অধ্যায় 6.3-এর সাধারণ প্রম্পট-সাড়া কলের মধ্যকার পুরো পার্থক্য। একটি একক কল একটি প্রশ্নের উত্তর দেয়। একটি এজেন্ট তার ইমেইল পড়ে, একটি ডেটাবেস খোঁজে, একটি টিকিট দাখিল করে, ফল পরীক্ষা করে এবং আবার চেষ্টা করে। মডেল আর কেবল পাঠ্য তৈরি করছে না; সে আপনার সিস্টেমে কাজ বাছছে।

সেই সরণ প্রকৌশল সমস্যা বদলায়। যখন একটি মডেল কেবল শব্দ লেখে, একটি খারাপ আউটপুট একটি খারাপ বাক্য। যখন একটি মডেল টুল চালায়, একটি খারাপ আউটপুট একটি ভুল বার্তা পাঠাতে, একটি রেকর্ড মুছতে বা অর্থ সরাতে পারে। তাই একটি বুদ্ধিমান এজেন্ট সবচেয়ে ভালো বোঝা যায় একটি বিশ্বস্ত সিস্টেমের ভেতরে বসা একটি অবিশ্বস্ত পরিকল্পনাকারী হিসেবে, এবং আপনার বেশিরভাগ কাজ যায় সেই পরিকল্পনাকারীকে কী করতে দেওয়া হবে তা সীমিত করতে। এই অধ্যায় অধ্যায় 6.3-এর LLM ভিত্তি, অধ্যায় 6.5-এর আস্থা ও জবাবদিহি উদ্বেগ এবং অধ্যায় 6.6-এর প্ল্যাটফর্ম চর্চার ওপর সরাসরি গড়া।

বড় দলের জন্য ঝুঁকি প্রযুক্তিগতের মতোই সাংগঠনিক। এন্টারপ্রাইজ প্রকৃত অভ্যন্তরীণ সিস্টেমে (টিকিটিং, অর্থ, গ্রাহক রেকর্ড) জোড়া এজেন্ট চায়, যার মানে এজেন্ট প্রকৃত অ্যাক্সেস নিয়ন্ত্রণ ও প্রকৃত পরিবর্তন-ব্যবস্থাপনা বাধ্যবাধকতা উত্তরাধিকার পায়। সরকার জনগণের কাছে জবাবদিহি যোগ করে: একজন নাগরিককে প্রভাবিত করা একটি স্বয়ংক্রিয় কাজ ঘটনার পরে ব্যাখ্যাযোগ্য, তত্ত্বাবধানযোগ্য ও নিরীক্ষণযোগ্য হতে হবে। প্যাটার্ন শক্তিশালী। শৃঙ্খলা ছাড়া ডিপ্লয় করলে এটি ভুল স্বয়ংক্রিয় করার দ্রুত উপায়।

মূল নীতিসমূহ

  • একটি এজেন্ট হলো একটি মডেল সঙ্গে একটি লুপ, টুল, স্মৃতি ও একটি লক্ষ্য। ঝুঁকি লুপে বাস করে, গদ্যে নয়।
  • কাজে স্বায়ত্তশাসন সীমিত করুন। কাজ সম্পন্ন করে এমন ক্ষুদ্রতম স্বাধীনতা দিন।
  • ধাপ জানা থাকলে একটি নির্দিষ্ট কর্মপ্রবাহ পছন্দ করুন। জানা না থাকলেই কেবল উন্মুক্ত-প্রান্ত স্বায়ত্তশাসনের দিকে হাত বাড়ান।
  • প্রতিটি টুলকে আক্রমণ-পৃষ্ঠ গণ্য করুন এবং সে যা নিয়ে কাজ করতে পারে সেই ন্যূনতম বিশেষাধিকার দিন।
  • গুরুত্বপূর্ণ বা অপরিবর্তনীয় কাজের জন্য চক্রে একজন মানুষ রাখুন, এবং ফিরিয়ে নেওয়া সস্তা করুন।
  • ট্রান্সক্রিপ্ট কেমন পড়ে তা নয়, কাজ সাফল্যে মূল্যায়ন করুন।
  • প্রতিটি রান ট্রেস করুন। যে কাজ আপনি পুনর্গঠন করতে পারেন না তা আপনি শাসন করতে পারেন না।
  • যে সরলতম নকশা কাজ করে সাধারণত সেটিই সঠিক। প্রায়ই সেটি আদৌ একটি এজেন্ট নয়।

সুপারিশ

একটি কর্মপ্রবাহ দিয়ে শুরু করুন, কেবল যেখানে বাধ্য সেখানে স্বায়ত্তশাসন যোগ করুন

সবচেয়ে সাধারণ ভুল হলো একটি নির্দিষ্ট পাইপলাইন কাজ করত এমন জায়গায় একটি স্বায়ত্তশাসিত এজেন্টের দিকে হাত বাড়ানো। আপনি ইতিমধ্যে ধাপ জানলে (ক্ষেত্র বের করা, যাচাই, একটি রেকর্ড খোঁজা, একটি উত্তর খসড়া), সেটি নির্দিষ্ট স্লট পূরণ করা মডেলসহ একটি অর্কেস্ট্রেটেড কর্মপ্রবাহ হিসেবে লিখুন। স্বায়ত্তশাসন তার জায়গা অর্জন করে যখন পথ সত্যিই আগে ঠিক করা যায় না, যেমন উন্মুক্ত-প্রান্ত গবেষণা বা অনেক সম্ভাব্য টুল জুড়ে ট্রায়াজ। কাজে স্বায়ত্তশাসন সীমিত করুন: ধাপের সংখ্যায় সীমা দিন, টুল সেট এই লক্ষ্যের দরকার যা তাতে সীমিত করুন, এবং একটি স্পষ্ট থামার শর্ত ঠিক করুন। একটি ভালো নিয়ম হলো সমস্যা ঠিক যতটুকু স্বাধীনতা দাবি করে মডেলকে ততটুকুই দেওয়া, এক ডিগ্রি বেশি নয়।

টুল ব্যবহারকে মূল সামর্থ্য করুন, এবং নিরাপদ করুন

টুল ব্যবহার (ফাংশন কলিংও বলা হয়) একটি মডেলকে এজেন্টে পরিণত করে। প্রতিটি টুল একটি সুনির্দিষ্ট স্কিমাসহ সংজ্ঞায়িত করুন, মডেল জোগানো প্রতিটি আর্গুমেন্ট যাচাই করুন, এবং ন্যূনতম বিশেষাধিকারের নীতি প্রয়োগ করুন: একটি কেবল-পঠনযোগ্য প্রতিবেদন এজেন্ট কেবল-পঠনযোগ্য ক্রেডেনশিয়াল পায়, কখনো অপব্যবহার করতে পারে এমন লেখার অ্যাক্সেস নয়। একটি স্যান্ডবক্স-এর ভেতরে টুল চালান যাতে একটি খারাপ কল তার ক্ষতির পরিসর ছাড়াতে না পারে। কয়েকটি বিস্তৃত টুলের চেয়ে অনেক সংকীর্ণ, একক-উদ্দেশ্য টুল পছন্দ করুন, কারণ একটি সংকীর্ণ টুল যুক্তি, অনুমতি ও নিরীক্ষা করা সহজ। এটি সেই একই সংযম যা অধ্যায় 6.3 LLM টুল ব্যবহারের জন্য তাগিদ দেয়, এখানে কেন্দ্রীয় করা।

সুস্পষ্ট যুক্তি ও পরিকল্পনা প্যাটার্ন ব্যবহার করুন

এজেন্টের চিন্তা কাঠামোবদ্ধ হলে তারা ভালো কাজ করে। একটি যুক্তি-ও-কাজ প্যাটার্নে (ReAct গবেষণা দ্বারা জনপ্রিয়), মডেল পরিস্থিতি নিয়ে যুক্তি করা ও একটি কাজ নেওয়ার মধ্যে পর্যায়ক্রমে চলে, তারপর আবার যুক্তির আগে ফল পর্যবেক্ষণ করে। কঠিনতর লক্ষ্যের জন্য মডেলকে আগে পরিকল্পনা (উপকাজে ভাঙা) তারপর সম্পাদন করতে বলুন, যাতে আপনি কোনো টুল চলার আগে পরিকল্পনা পরীক্ষা এবং এমনকি অনুমোদন করতে পারেন। এই লুপ পর্যবেক্ষণযোগ্য ও বাধাযোগ্য রাখুন। যে পরিকল্পনা আপনি পড়তে পারেন তা আপনি থামাতে পারেন।

গুরুত্বপূর্ণ কাজের জন্য মানুষকে চক্রে রাখুন

প্রতি টুল ও প্রতি কাজে ঠিক করুন মডেল একা কাজ করতে পারে নাকি আগে জিজ্ঞেস করতে হবে। ফেরানো যায় এমন, কম-ঝুঁকির কাজ (অনুসন্ধান, খসড়া) অ-তত্ত্বাবধানে চলতে পারে। গুরুত্বপূর্ণ বা অপরিবর্তনীয় কাজ (বাইরের যোগাযোগ পাঠানো, অর্থ সরানো, প্রোডাকশন ডেটা বদলানো, একজন নাগরিকের কেস নির্ধারণ) না বলার প্রকৃত কর্তৃত্বসহ একটি মানব-চক্রে গেট দরকার। যেখানে পারেন ফেরানোযোগ্যতার জন্য নকশা করুন: কমিট করার বদলে একটি পরিবর্তন স্টেজ করা পছন্দ করুন, এবং পূর্বাবস্থা ফেরানোকে প্রথম-শ্রেণির ফিচার করুন যাতে একটি ভুল কাজ ঘটনার বদলে মিনিট খরচ করে।

নিরাপত্তা মডেলকে বিরোধী গণ্য করুন

এজেন্ট অধ্যায় 4.2-এ বর্ণিত আক্রমণ-পৃষ্ঠ প্রসারিত করে। মূল হুমকি প্রম্পট ইনজেকশন: একটি ওয়েব পাতা, নথি বা ইমেইলে লুকানো ক্ষতিকর নির্দেশ যা এজেন্ট পড়ে ও মানে। ঘনিষ্ঠভাবে সম্পর্কিত কনফিউজড ডেপুটি সমস্যা, যেখানে একজন আক্রমণকারী একটি বিশেষাধিকারপ্রাপ্ত এজেন্টকে তার নিজের বৈধ অ্যাক্সেস অপব্যবহার করতে ঠকায়, উদাহরণস্বরূপ এজেন্টের কল করার অনুমতি থাকা একটি টুলের মাধ্যমে ডেটা বের করা। ধরে নিন এজেন্ট যে কনটেন্ট গ্রহণ করে তা বৈরী হতে পারে। বিশ্বস্ত নির্দেশ অবিশ্বস্ত ডেটা থেকে আলাদা করুন, টুল সীমিত করুন যাতে একটি ছিনিয়ে নেওয়া এজেন্ট সংবেদনশীল সিস্টেমে পৌঁছাতে না পারে, এবং যাচাই ছাড়া কাঁচা মডেল আউটপুটকে কখনো অপরিবর্তনীয় কাজ ট্রিগার করতে দেবেন না।

কাজ সাফল্যে মূল্যায়ন করুন এবং অ-নির্ধারণবাদ রিগ্রেশন-পরীক্ষা করুন

এজেন্ট বিচার করুন তারা কাজ সম্পন্ন করে কি না দিয়ে, ট্রান্সক্রিপ্ট চতুর শোনায় কি না দিয়ে নয়। পরীক্ষাযোগ্য সাফল্য মানদণ্ডসহ প্রতিনিধিত্বমূলক লক্ষ্যের একটি মূল্যায়ন সেট গড়ুন (টিকিট কি সঠিক অগ্রাধিকার পেয়েছে, ফেরত কি নীতির সঙ্গে মিলেছে) এবং প্রতিটি প্রম্পট, মডেল বা টুল পরিবর্তনে চালান। কারণ এজেন্ট অ-নির্ধারণবাদী, একটি একক পাস সামান্য প্রমাণ করে: প্রতিটি কেস একাধিকবার চালান এবং পাস বা ব্যর্থের বদলে একটি সাফল্য হার অনুসরণ করুন। এটি অধ্যায় 6.3 ও 6.2 (মেশিন লার্নিং প্রকৌশল ও MLOps)-এর অফলাইন ও অনলাইন মূল্যায়ন শৃঙ্খলা এমন সিস্টেমে প্রসারিত করে যার আউটপুট কাজের একটি ক্রম।

পর্যবেক্ষণযোগ্যতা, খরচ ও ব্যর্থতা পরিচালনার জন্য রান যন্ত্রসজ্জিত করুন

আপনি যা দেখতে পান না তা শাসন করতে পারেন না। প্রতিটি এজেন্ট রান শুরু থেকে শেষ পর্যন্ত ট্রেস করুন (অধ্যায় 6.6): লক্ষ্য, প্রতিটি যুক্তি ধাপ, আর্গুমেন্ট ও ফলসহ প্রতিটি টুল কল, ব্যয়িত টোকেন এবং চূড়ান্ত ফল। এই ট্রেসিং একসঙ্গে আপনার ডিবাগার, আপনার নিরীক্ষা ট্রেইল এবং আপনার খরচ মিটার। ধাপ, সময় ও ব্যয়ে কঠিন বাজেট ঠিক করুন, কারণ লুপ করা একটি এজেন্ট দ্রুত বিলম্ব ও অর্থ পোড়াতে পারে। ব্যর্থতা সুস্পষ্টভাবে সামলান: অস্থায়ী টুল ত্রুটি ব্যাকঅফসহ পুনঃচেষ্টা করুন, কিন্তু যেখানে মডেল একটি ব্যর্থ কাজ পুনরাবৃত্তি করে সেই লুপ শনাক্ত করুন, এবং ছটফট করার বদলে নিরাপদে ব্যর্থ হন।

ট্রেড-অফ: সুবিধা ও অসুবিধা

পছন্দসুবিধাঅসুবিধাসবচেয়ে ভালো যখন
নির্দিষ্ট কর্মপ্রবাহ (মডেল স্লট পূরণ করে)পূর্বাভাসযোগ্য, সস্তা, পরীক্ষা ও নিরীক্ষা সহজঅনমনীয়; অপ্রত্যাশিত পথে ভাঙেধাপ আগে থেকে জানা
স্বায়ত্তশাসিত একক এজেন্টনমনীয়; উন্মুক্ত-প্রান্ত লক্ষ্য সামলায়নিয়ন্ত্রণ, মূল্যায়ন ও সীমিত করা কঠিনতরপথ আগে ঠিক করা যায় না
বহু-এজেন্ট অর্কেস্ট্রেশনসমান্তরালতা; বিশেষায়িত ভূমিকাসমন্বয় খরচ, চক্রবৃদ্ধি ত্রুটি, বেশি ব্যয়একটি কাজ সত্যিই স্বাধীন অংশে ভাঙে
অ-তত্ত্বাবধান কাজদ্রুত, কম ঘর্ষণপরীক্ষা ছাড়া ভুল সম্পাদিত হয়কাজ ফেরানো যায় ও কম-ঝুঁকির
মানব-চক্রে গেটনিরাপত্তা, জবাবদিহি, ফেরানোযোগ্যতাধীরতর; পর্যালোচক ক্ষমতা লাগেকাজ গুরুত্বপূর্ণ বা অপরিবর্তনীয়

কেন্দ্রীয় টানাপোড়েন স্বায়ত্তশাসন বনাম নিয়ন্ত্রণ। বেশি স্বায়ত্তশাসন বেশি পরিস্থিতি সামলায় কিন্তু বেশি গার্ডরেইল, বেশি মূল্যায়ন এবং বেশি অর্থ দাবি করে, এবং ভবিষ্যদ্বাণী করা কঠিনতর উপায়ে ব্যর্থ হয়। বহু-এজেন্ট নকশা দলকে লাবণ্য দিয়ে প্রলুব্ধ করে, তবু প্রতিটি অতিরিক্ত এজেন্ট সমন্বয় বাড়তি বোঝা এবং একটি ছোট ত্রুটি একটি ভুল ফলে চক্রবৃদ্ধি হওয়ার আরেকটি জায়গা যোগ করে। সমস্যা সমাধান করে এমন ন্যূনতম স্বায়ত্তশাসন দিয়ে শুরু করে এবং একটি সুনির্দিষ্ট কাজ বাধ্য করলেই কেবল স্বাধীনতা যোগ করে, সবসময় একটি মানানসই গার্ডরেইলের সঙ্গে জুড়ে এর সমাধান করুন।

আপনার দলের সঙ্গে আলোচনার প্রশ্ন

  1. এই ফিচারের কি আসলে একটি এজেন্ট দরকার, নাকি একটি নির্দিষ্ট কর্মপ্রবাহ নিরাপদ ও সস্তা হতো? স্বায়ত্তশাসন লোভনীয়, কিন্তু বেশিরভাগ কাজের জানা ধাপ আছে যা একটি অর্কেস্ট্রেটেড পাইপলাইন অনেক কম ঝুঁকিতে সামলায়। একটি বড় দলের জন্য এজেন্টে ডিফল্ট করা মানে প্রতিটি গোষ্ঠী মূল্যায়ন, ট্রেসিং ও নিরাপত্তা বোঝা নেয় যা একটি সরলতর নকশা এড়াত। নির্দিষ্ট কাজ আনুন এবং জিজ্ঞেস করুন তার ধাপ আগে ঠিক করা যায় কি না; যায় হলে একটি এজেন্ট সম্ভবত অতি-প্রকৌশল। উন্মুক্ত-প্রান্ত স্বায়ত্তশাসন সেই লক্ষ্যের জন্য সংরক্ষণ করুন যেখানে পথ প্রতি কেসে সত্যিই ভিন্ন। উত্তর বেশিরভাগ ফিচারকে একটি কর্মপ্রবাহের দিকে ঠেলা এবং একটি ছোট, সুচিন্তিত সেট প্রকৃত এজেন্ট হিসেবে রাখা উচিত।

  2. আমাদের এজেন্ট কল করতে পারে এমন প্রতিটি টুলের জন্য, একটি ছিনিয়ে নেওয়া এজেন্ট তা দিয়ে সবচেয়ে খারাপ কী করতে পারে, এবং কী তা ঠেকায়? প্রম্পট ইনজেকশন ও কনফিউজড-ডেপুটি আক্রমণ এজেন্টের নিজস্ব বৈধ অ্যাক্সেস আপনার বিরুদ্ধে ঘোরায়, তাই সঠিক লেন্স বিরোধী (অধ্যায় 4.2)। প্রতিটি টুল, তার বিশেষাধিকার পরিসর, এবং গৃহীত কনটেন্টের মাধ্যমে পাচার করা একটি ক্ষতিকর নির্দেশ তাতে পৌঁছাতে পারে কি না তার তালিকা করুন। অভ্যন্তরীণ সিস্টেমে এজেন্ট জোড়া এন্টারপ্রাইজের জন্য এখানেই ন্যূনতম বিশেষাধিকার, স্যান্ডবক্সিং এবং অপরিবর্তনীয় কাজে মানব গেট প্রকৃত হয়। টুলের তালিকা এবং প্রতিটি যে ক্রেডেনশিয়াল ধরে তা আনুন। কোনো গুরুত্বপূর্ণ কাজ যাচাই বা মানব পরীক্ষা ছাড়া পৌঁছানো গেলে তাই প্রথম সারার।

  3. প্রতিটি রান বিশ্বাসযোগ্য দেখায় বলে একটি এজেন্টের সাফল্য হার কমে গেছে আমরা কীভাবে জানব? এজেন্ট অ-নির্ধারণবাদী, তাই ভালো পড়া একটি ট্রান্সক্রিপ্টও ভুল কাজ নিয়ে থাকতে পারে, এবং একটি সবুজ রান কিছুই প্রমাণ করে না। জিজ্ঞেস করুন আপনার পরীক্ষাযোগ্য ফলসহ লক্ষ্যের একটি মূল্যায়ন সেট আছে কি না, একটি একক পাসের বদলে সাফল্য হার তৈরি করতে প্রতি কেসে অনেকবার চালানো। উচ্চ-ঝুঁকি বা জনসাধারণের ডিপ্লয়মেন্টের জন্য আলোচনা করুন রান ট্রেস কিছু ভুল হলে ঠিক কী ঘটেছিল পুনর্গঠন করতে কীভাবে দেয় (অধ্যায় 6.5 ও 6.6)। আপনার একমাত্র সংকেত ব্যবহারকারীর অভিযোগ হলে আপনি ইতিমধ্যে অনেক দেরিতে। উত্তর ঘটনার পরে নয়, স্কেলের আগে একটি মূল্যায়ন হার্নেসে অর্থায়ন করা উচিত।

  4. এই এজেন্টের কোন কাজ সত্যিই অপরিবর্তনীয়, কার তা অনুমোদনের কর্তৃত্ব আছে, এবং সেই গেটে কর্মী দেওয়ার মতো পর্যালোচক ক্ষমতা কি আমাদের আছে? প্রলোভন হলো মডেলকে সর্বত্র অ-তত্ত্বাবধানে কাজ করতে দেওয়া, কিন্তু একটি মানব গেট কেবল প্রকৃত যখন এজেন্ট জিজ্ঞেস করলে না বলার কর্তৃত্বসহ একজন নামকরা ব্যক্তি উপলব্ধ। একটি বড় দলের জন্য কেউ মালিক নয় এমন একটি অনুমোদন সারি নিঃশব্দে রাবার স্ট্যাম্পে পরিণত হয়, এবং আপনি নকশা করা নিরাপত্তা পরিমাণের চাপে বাষ্প হয়। এজেন্ট নিতে পারে এমন সব কাজের তালিকা আনুন, প্রতিটি ফেরানোযোগ্য বা অপরিবর্তনীয় চিহ্নিত করুন, এবং একজন পর্যালোচকের ওপর নামা নিম্ন-আস্থার কেসের দৈনিক পরিমাণ অনুমান করুন। একটি গেটের ঘর্ষণ ও কর্মী খরচ একটি অ-তত্ত্বাবধান ভুলের ক্ষতির পরিসরের বিপরীতে ওজন করুন, এবং আরেকজন পর্যালোচক যোগ করার চেয়ে একটি অপরিবর্তনীয় কাজ একটি স্টেজ করা, ফেরানোযোগ্য কাজে পুনঃনকশা পছন্দ করুন। এন্টারপ্রাইজ ও সরকারি পরিবেশে প্রতিটি গুরুত্বপূর্ণ কাজ একজন জবাবদিহিযোগ্য কর্মকর্তা ও একটি পরিবর্তন-ব্যবস্থাপনা রেকর্ডের সঙ্গে বাঁধুন, কারণ একজন নাগরিক বা গ্রাহককে প্রভাবিত করা একটি স্বয়ংক্রিয় কাজ যা কোনো মানুষ অনুমোদন করেনি ঠিক সেই ব্যর্থতা যা একটি নিরীক্ষা খুঁজে পাবে।

  5. আমরা কি একটি বহু-এজেন্ট নকশার দিকে হাত বাড়াচ্ছি কারণ কাজ সত্যিই ভাঙে, নাকি কারণ এটি লাবণ্যময় দেখায়? বিশেষায়িত এজেন্ট জুড়ে কাজ ভাগ করা লোভনীয়, তবু প্রতিটি অতিরিক্ত এজেন্ট সমন্বয় বাড়তি বোঝা এবং একটি ছোট ত্রুটি একটি ভুল ফলে চক্রবৃদ্ধি হওয়ার আরেকটি জায়গা যোগ করে। একটি বড় প্রতিষ্ঠানের জন্য খরচ কেবল ব্যয় ও বিলম্ব নয়: একটি বহু-এজেন্ট সিস্টেম ব্যর্থ হলে ট্রেস, মূল্যায়ন ও যুক্তি করা অনেক কঠিন, তাই আপনি যোগ করা প্রতিটি ভূমিকার সঙ্গে শাসন বোঝা বহুগুণ হয়। কাজ আনুন এবং সুনির্দিষ্টভাবে দেখান কোন অংশ স্বাধীনভাবে ও সমান্তরালে চলে, তারপর একই মূল্যায়ন সেটে একটি একক এজেন্টের বিপরীতে একটি বহু-এজেন্ট সংস্করণের মাপা সাফল্য হার ও খরচ তুলনা করুন। একক এজেন্ট জিতলে বা সমান হলে লাবণ্যময় নকশা অতি-প্রকৌশল। নিয়ন্ত্রিত বা সরকারি ডিপ্লয়মেন্টের জন্য মনে রাখুন শৃঙ্খলে প্রতিটি এজেন্ট একটি তত্ত্বাবধান সংস্থাকে পরীক্ষা করতে পারতে হবে এমন আরেকটি উপাদান, তাই আপনি যথার্থ করতে পারেন না এমন বাড়তি কাঠামো বাড়তি দায়।

  6. একটি এজেন্টের ধাপ, সময় ও ব্যয়ের কঠিন বাজেট কী, এবং একটি লুপ করা এজেন্ট খরচ বা বিলম্ব বাড়ানোর আগে কীভাবে ধরা পড়বে? একটি ব্যর্থ কাজ পুনরাবৃত্তি করা এজেন্ট সতর্কতা ছাড়াই অর্থ ও সময় পোড়াতে পারে, তাই অসীম স্বায়ত্তশাসন নিরাপত্তার মতোই আর্থিক ঝুঁকি। অনেক এজেন্ট চালানো একটি বড় দলের জন্য একটি একক ভুল আচরণকারী লুপ একটি ক্লাউড বিল বাড়াতে বা অন্য প্রতিটি ওয়ার্কলোডকে বঞ্চিত করা একটি হার সীমা নিঃশেষ করতে পারে, যা প্রতি-রান সীমাকে এক দলের সমস্যার বদলে একটি ভাগ করা পরিচালনগত উদ্বেগ করে। প্রতিটি এজেন্টের বর্তমান ধাপ, সময় ও টোকেন বাজেট, সীমা ছাড়ালে যে সতর্কতা ফায়ার করে, এবং ছটফট করার বদলে নিরাপদে ব্যর্থ হওয়া লুপ-শনাক্তকরণ আনুন। আঁটো বাজেট, যা একটি বৈধভাবে কঠিন কাজ কেটে দিতে পারে, আলগা বাজেটের বিপরীতে ওজন করুন যা খরচ ছুটতে দেয়। ব্যয় পূর্বাভাস ও যথার্থ করতে হয় এমন এন্টারপ্রাইজ ও সরকারি পরিবেশে অসীম খরচের একটি এজেন্ট একটি বাজেট পর্যালোচনা বা নিরীক্ষায় আপনি রক্ষা করতে পারেন না এমন একটি লাইন আইটেম।

খাতভেদে দৃষ্টিভঙ্গি

স্টার্টআপ। আপনার মূল মূল্য ছোঁয়া একটি সংকীর্ণ এজেন্ট একটি হোস্টেড মডেলে পাঠান, কাজ করে এমন ক্ষুদ্রতম টুল সেট এবং ধাপ ও ব্যয়ে একটি কঠিন সীমাসহ। বহু-এজেন্ট ডেমো প্রতিরোধ করুন: আপনার দুর্লভ প্রকৌশল মনোযোগ আপনি রক্ষণাবেক্ষণ করতে পারবেন না এমন ভূমিকা সমন্বয়ের চেয়ে একটি একক এজেন্টের স্বায়ত্তশাসন সীমিত করা ও তার রান ট্রেস করায় ভালো ব্যয় হয়। প্রতিটি গুরুত্বপূর্ণ কাজ একটি একক “খসড়া করুন, কখনো পাঠাবেন না” গেটের পেছনে রাখুন যাতে একটি ভুল পূর্বাবস্থায় একটি ক্লিক খরচ করে, একটি ঘটনা নয়।

ছোট ব্যবসা। আপনার একটি মূল্যায়ন হার্নেস বা স্যান্ডবক্স চালানোর কেউ নেই, তাই আপনি ইতিমধ্যে বিশ্বাস করা টুলে এমবেড করা এজেন্ট পছন্দ করুন, এবং কেবল সেই স্বায়ত্তশাসন চালু করুন যা আপনি চোখে তত্ত্বাবধান করতে পারেন। আপনার পক্ষে পাঠাতে, পরিশোধ করতে বা মুছতে পারে এমন যেকোনো এজেন্ট একজন মানুষ প্রতিটি কাজ নিশ্চিত করা পর্যন্ত বন্ধ রাখুন, কারণ একজন গ্রাহককে একটি ভুল স্বয়ংক্রিয় বার্তা আপনাকে সম্পর্ক খরচ করায়। এজেন্ট কী করেছে দেখায় এবং স্বয়ংক্রিয়তা বন্ধ করতে দেয় এমন বিক্রেতা পছন্দ করুন।

এন্টারপ্রাইজ। সমস্যা অনেক দল জুড়ে এজেন্ট শাসন: স্বায়ত্তশাসন সীমিত করা, ন্যূনতম-বিশেষাধিকার টুল ক্রেডেনশিয়াল, স্যান্ডবক্সিং, মানব-চক্রে গেট এবং শুরু-থেকে-শেষ ট্রেসিংয়ের ভাগ করা প্যাটার্ন যাতে কোনো গোষ্ঠী গার্ডরেইল পুনরাবিষ্কার করে না। একজন মানুষ যে অ্যাক্সেস নিয়ন্ত্রণ ধরে সেই একই নিয়ন্ত্রণের অধীনে এজেন্টকে অভ্যন্তরীণ সিস্টেমে জুড়ুন, অপরিবর্তনীয় কাজ নামকরা অনুমোদনকারী ও পরিবর্তন ব্যবস্থাপনার পেছনে গেট করুন, এবং সাফল্য-হার মেট্রিক, প্রতি-রান বাজেট ও বিরোধী ইনজেকশন পরীক্ষাসহ পোর্টফোলিও পরিচালনা করুন। ট্রেসিং ও মূল্যায়ন স্তর প্রমিত করুন যাতে যেকোনো এজেন্টের আচরণ পুনর্গঠন ও নিরীক্ষা করা যায়।

সরকার। ক্রয়, স্বচ্ছতা ও জনগণের কাছে জবাবদিহি প্রতিটি পছন্দ সীমিত করে। এজেন্টকে তথ্য সংগ্রহ ও খসড়ায় রাখুন, এবং একজন নাগরিককে প্রভাবিত করা প্রতিটি সিদ্ধান্ত একজন জবাবদিহিযোগ্য মানুষের জন্য সংরক্ষণ করুন, কারণ একটি সরকারি-খাত সিদ্ধান্তের দায়িত্ব একটি মডেলে অর্পণ করা যায় না। প্রতিটি রান লগ করুন যাতে একটি তত্ত্বাবধান সংস্থা দেখতে পারে কোন উৎস পরামর্শ করা হয়েছে ও কী করা হয়েছে, বিক্রেতাদের এজেন্টের টুল ও সীমাবদ্ধতা প্রকাশ করতে দাবি করুন, এবং একটি বিরোধী মূল্যায়ন সেটের মাধ্যমে প্রমাণ করুন এজেন্ট তার সীমিত পরিধির বাইরে কাজ করতে প্রত্যাখ্যান করে।

উদাহরণ

স্টার্টআপ। পাঁচজনের একটি বিশ্লেষণ স্টার্টআপ একটি সহায়তা ট্রায়াজ এজেন্ট গড়ে। এটি একটি আসা টিকিট পড়ে, ডক্স খোঁজে, এবং হয় একটি উত্তর খসড়া করে নয়তো টিকিট একজন মানুষের কাছে রুট করে, আর এটিই পুরো টুল সেট। ক্রেডেনশিয়াল কেবল-পঠনযোগ্য এবং একটি একক “খসড়া তৈরি” কাজ যা একজন মানুষ পাঠান ক্লিক না করা পর্যন্ত কখনো পাঠায় না। প্রতিটি রান ট্রেস করা যাতে প্রতিষ্ঠাতারা দেখতে পারে একটি টিকিট কেন যেখানে রুট করা হয়েছিল, এবং পঞ্চাশটি প্রকৃত টিকিটের একটি রাতের মূল্যায়ন সেট রুটিং-নির্ভুলতা হার অনুসরণ করতে প্রতিটি এজেন্টকে পাঁচবার করে চালায়। একজন প্রতিযোগীর চতুর বহু-এজেন্ট ডেমো তাদের প্রলুব্ধ করলেও তারা একক-এজেন্ট থাকে কারণ তাদের কাজ ভাঙে না।

এন্টারপ্রাইজ। একটি ব্যাংক পরিচালনা কর্মীদের ব্যর্থ পেমেন্ট মেলাতে সাহায্য করতে একটি এজেন্ট গড়ে। এটি একজন মানব কেরানির যে অ্যাক্সেস নিয়ন্ত্রণ আছে সেই একই অধীনে অভ্যন্তরীণ সিস্টেমের সঙ্গে সমন্বিত, কেবল মিলান পরিসরে সীমিত ন্যূনতম-বিশেষাধিকার সার্ভিস ক্রেডেনশিয়ালের মাধ্যমে দেওয়া। এজেন্ট অবাধে তদন্ত করতে পারে (খতিয়ান পড়া, লেনদেন ইতিহাস খোঁজা) কিন্তু অর্থ সরায় বা একটি রেকর্ড সম্পাদনা করে এমন যেকোনো কাজ স্টেজ করা এবং একজন নামকরা মানব অনুমোদনকারী দাবি করে, পরিবর্তন ব্যবস্থাপনা সন্তুষ্ট করে। গৃহীত নথি প্রম্পট ইনজেকশন ভোঁতা করতে অবিশ্বস্ত গণ্য, টুল স্যান্ডবক্সে চলে, এবং প্রতিটি রান নিরীক্ষার জন্য শুরু-থেকে-শেষ ট্রেস করা। একটি অফলাইন মূল্যায়ন সেট প্রতিটি মডেল বা প্রম্পট পরিবর্তন গেট করে, এবং প্রতি-রান বাজেট ধাপ ও ব্যয় সীমিত করে যাতে একটি লুপ করা এজেন্ট খরচ বা বিলম্ব বাড়াতে না পারে।

সরকার। একটি সুবিধা সংস্থা একটি দাবির তথ্য সংগ্রহে কেসওয়ার্কারদের সাহায্য করতে একটি এজেন্টের পাইলট করে: রেকর্ড টানা, যোগ্যতা নিয়ম পরীক্ষা এবং একটি সারসংক্ষেপ খসড়া। সংস্থা একটি কঠিন রেখা টানে: এজেন্ট সংগ্রহ ও খসড়া করে, কিন্তু একজন মানব কেসওয়ার্কার একজন নাগরিককে প্রভাবিত করা প্রতিটি সিদ্ধান্ত নেন ও তার মালিক, কারণ সরকারি-খাত সিদ্ধান্তের জবাবদিহি একটি মডেলে অর্পণ করা যায় না (অধ্যায় 6.5)। প্রতিটি রান সম্পূর্ণ লগ করা, কোন উৎস পরামর্শ করা হয়েছে ও কী খসড়া হয়েছে দেখিয়ে, যাতে একটি তত্ত্বাবধান সংস্থা যেকোনো কেস নিরীক্ষা করতে পারে। স্বায়ত্তশাসন সুচিন্তিতভাবে পড়া-ও-খসড়ায় সীমিত, টুল ন্যূনতম-বিশেষাধিকার ও স্যান্ডবক্সড, এবং একটি বিরোধী মূল্যায়ন সেট নিশ্চিত করে এজেন্ট তথ্য সংগ্রহের বাইরে কাজ করতে প্রত্যাখ্যান করে।

ব্যবসায়িক যুক্তি: প্রেরণা, ROI ও TCO

এজেন্ট বহু-ধাপ কাজ স্বয়ংক্রিয় করে প্রতিদান দেয় যা আগে সিস্টেমের মধ্যে ক্লিক করতে একজন মানুষ লাগত: ট্রায়াজ, মিলান, গবেষণা ও নিয়মিত পরিচালনা। মূল্য দেখা দেয় প্রতিটি ধাপে একজন মানুষ ছাড়া সম্পন্ন কাজ, দ্রুততর চক্র সময় এবং বিচার-ভারী কাজের জন্য মুক্ত কর্মী হিসেবে। কারণ এজেন্ট বিদ্যমান LLM ও টুলে গড়া, একটি কার্যকর প্রোটোটাইপের সময় ছোট, ঠিক যে কারণে দলগুলো অতি-গড়ে।

মালিকানার মোট খরচে এজেন্ট সাধারণ LLM ফিচার থেকে ভিন্ন। অনুমান খরচের ওপরে আপনি টুল ইন্টিগ্রেশন, স্যান্ডবক্সিং ও অনুমতি নল, মূল্যায়ন হার্নেস, ট্রেসিং ও পর্যবেক্ষণযোগ্যতা স্ট্যাক (অধ্যায় 6.6) এবং অনুমোদন গেটে কর্মী দেওয়া মানব পর্যালোচকের জন্য অর্থ দেন। একটি লুপ করা বা খারাপভাবে সীমিত এজেন্ট সতর্কতা ছাড়াই স্পাইক হতে পারা একটি পরিবর্তনশীল খরচ যোগ করে, তাই ধাপ ও ব্যয়ের বাজেট নকশার অংশ, পরের ভাবনা নয়। গ্রহণ না করার খরচ ধীরতর পরিচালনা এবং আপনার প্রতিযোগীরা স্বয়ংক্রিয় করে এমন ম্যানুয়াল পরিশ্রম। অসাবধানে গ্রহণ করার খরচ একটি স্বায়ত্তশাসিত কাজ যা ভুল বার্তা পাঠায়, ডেটা ফাঁস করে বা একটি অজবাবদিহি সিদ্ধান্ত নেয়। একটি সুনির্দিষ্ট স্বয়ংক্রিয়তা লক্ষ্যকে গার্ডরেইল, মূল্যায়ন ও মানব তত্ত্বাবধানের একটি সুনির্দিষ্ট পরিকল্পনার সঙ্গে জোড়া দিয়ে, এবং গার্ডরেইলই খরচের বেশিরভাগ সে বিষয়ে সৎ থেকে নেতৃত্বের কাছে যুক্তি দিন।

অ্যান্টি-প্যাটার্ন ও ফাঁদ

  • কর্মপ্রবাহ কাজ করত এমন জায়গায় এজেন্ট। জানা ধাপের একটি কাজের জন্য স্বায়ত্তশাসনের পূর্ণ ঝুঁকি নেওয়া।
  • অতি-বিস্তৃত টুল ও ক্রেডেনশিয়াল। সংকীর্ণ, ন্যূনতম-বিশেষাধিকার টুলের বদলে একটি “সবকিছু করুন” টুল।
  • প্রম্পট-ইনজেকশন অন্ধত্ব। প্রকৃত বিশেষাধিকারসহ একটি এজেন্টকে অবিশ্বস্ত কনটেন্ট খাওয়ানো।
  • অপরিবর্তনীয় কাজে মানব গেট নেই। মডেলকে পরীক্ষা ছাড়া পাঠাতে, পরিশোধ করতে বা মুছতে দেওয়া।
  • বহু-এজেন্ট নাট্য। কোনো লাভ ছাড়া সমন্বয় খরচ দিয়ে একটি সরল কাজ এজেন্ট জুড়ে ভাগ করা।
  • অনুভূতি-ভিত্তিক মূল্যায়ন। কাজ সাফল্য হারের বদলে ট্রান্সক্রিপ্ট কেমন পড়ে তা দিয়ে বিচার।
  • সীমাহীন লুপ। ধাপ, সময় বা ব্যয়ে কোনো সীমা নেই, তাই আটকে যাওয়া এজেন্ট অর্থ ও বিলম্ব পোড়ায়।
  • অ-ট্রেস করা রান। এজেন্ট কী করেছে তার কোনো রেকর্ড নেই, আপনি ডিবাগ, নিরীক্ষা বা জবাব দিতে অক্ষম।

পরিপক্বতা মডেল

  • স্তর ১, সূচনা: এজেন্ট বিস্তৃত টুল অ্যাক্সেস ও কোনো সীমা ছাড়া অ্যাড হক প্রোটোটাইপ করা। সাফল্য ডেমো দিয়ে, কিছু ভাঙার পরে প্রতিক্রিয়াশীলভাবে বিচার করা। কোনো মূল্যায়ন সেট, ট্রেসিং বা গুরুত্বপূর্ণ কাজে মানব গেট নেই।
  • স্তর ২, বিকাশ: কিছু এজেন্টের সীমিত লুপ ও ন্যূনতম-বিশেষাধিকার টুল আছে, এবং মৌলিক ট্রেসিং আছে, কিন্তু চর্চা দল থেকে দলে ভিন্ন। একটি ম্যানুয়াল মূল্যায়ন সেট কয়েকটি প্রকল্পে স্থূল রিগ্রেশন ধরে যখন অন্যদের কোনোটিই নেই। মানব অনুমোদন সবচেয়ে সুস্পষ্ট অপরিবর্তনীয় কাজ পাহারা দেয়, তবু কভারেজ অসম ও অনথিবদ্ধ।
  • স্তর ৩, মানসম্মতকরণ: ভাগ করা প্যাটার্ন স্বায়ত্তশাসন, টুল অনুমতি, স্যান্ডবক্সিং ও মানব-চক্রে গেট শাসন করে, নথিবদ্ধ ও প্রতিটি দলে প্রয়োগ করা। প্রতিটি গুরুত্বপূর্ণ কাজ গেট বা যাচাই করা, এজেন্ট শুরু-থেকে-শেষ ট্রেস করা, এবং সাফল্য-হার স্কোরিংসহ একটি স্বয়ংক্রিয় মূল্যায়ন সেট প্রতিটি পরিবর্তনে চলে। প্রম্পট ইনজেকশন একটি সংজ্ঞায়িত সাড়াসহ স্থায়ী হুমকি গণ্য।
  • স্তর ৪, ব্যবস্থাপনা: এজেন্ট পোর্টফোলিও ভিত্তিরেখার বিপরীতে মাপা ও নিয়ন্ত্রিত। প্রতি কাজে সাফল্য হার, প্রম্পট-ইনজেকশন প্রতিরক্ষা পাস হার, প্রতি রানে খরচ ও ধাপ গণনা, মানব-অনুমোদন বিলম্ব, এবং লুপ বা ব্যর্থতা ঘটনা মেট্রিক হিসেবে অনুসরণ করা; রোলব্যাক ও মেরে-ফেলার সীমা অভিযোগের বদলে সেই প্রমাণের ওপর প্রয়োগ করা। ধাপ, সময় ও ব্যয়ে প্রতি-রান বাজেট পর্যবেক্ষিত, এবং যেকোনো মেট্রিকে রিগ্রেশন ঘটনার পরে নয়, স্কেলের আগে পদক্ষেপ ট্রিগার করে।
  • স্তর ৫, সমন্বয়: স্বায়ত্তশাসন নীতি দ্বারা কাজের ঝুঁকির সঙ্গে মেলানো এবং ফল আসার সঙ্গে নিরন্তর সমন্বিত। চলমান অফলাইন ও অনলাইন মূল্যায়ন এজেন্ট আচরণ ব্যবসায়িক ফলাফলের সঙ্গে বাঁধে, এবং ঝুঁকি চিত্র সরলে প্রতিষ্ঠান নিয়মিত এজেন্ট অবসর, পুনর্নির্ধারণ বা পুনঃঅনুমতি দেয়। ট্রেসিং, খরচ বাজেট ও নিরীক্ষা ট্রেইল পোর্টফোলিও জুড়ে অভিন্ন; ইনজেকশন ও কনফিউজড-ডেপুটি প্রতিরক্ষা বিরোধীভাবে পরীক্ষিত; স্বায়ত্তশাসিত কাজের জন্য জবাবদিহি স্পষ্ট ও নিরীক্ষণযোগ্য।

আলোচনার ভাবনা

  1. আপনার কোন বর্তমান LLM ফিচার নিঃশব্দে এজেন্ট হয়ে উঠেছে, এবং প্রতিটির স্বায়ত্তশাসন কি উদ্দেশ্য নিয়ে সীমিত করা হয়েছে?
  2. প্রতিটি এজেন্ট টুলের জন্য, ইনজেক্ট করা কনটেন্টের মাধ্যমে একজন আক্রমণকারীর তা অপব্যবহারের সস্তাতম উপায় কী, এবং কী তা ঠেকায়?
  3. আপনি কোথায় বহু-এজেন্ট নকশা বেছেছেন, এবং আপনি কি দেখাতে পারেন সমন্বয় খরচ একটি একক এজেন্টের বিপরীতে লাভ দিয়েছে?
  4. কোন এজেন্ট কাজ সত্যিই অপরিবর্তনীয়, এবং প্রতিটি কি ফেরানোযোগ্য বা স্টেজ করা হিসেবে পুনঃনকশা করা যেত?
  5. কাল একটি এজেন্ট ক্ষতিকর কাজ নিলে, আপনি কি ঠিক সে কী করেছে এবং কে জবাবদিহিযোগ্য তা পুনর্গঠন করতে পারতেন?

প্রধান শিক্ষা

  • একটি এজেন্ট হলো টুল, স্মৃতি ও একটি লক্ষ্যসহ একটি লুপে একটি LLM। ঝুঁকি লুপ ও টুলে, পাঠ্যে নয়।
  • ধাপ জানা থাকলে একটি নির্দিষ্ট কর্মপ্রবাহ পছন্দ করুন; স্বায়ত্তশাসন সত্যিই উন্মুক্ত-প্রান্ত লক্ষ্যের জন্য সংরক্ষণ করুন এবং আঁটোভাবে সীমিত করুন।
  • টুল ব্যবহার মূল সামর্থ্য। প্রতিটি টুলকে ন্যূনতম বিশেষাধিকার, একটি যাচাইকৃত স্কিমা এবং একটি স্যান্ডবক্স দিন।
  • গুরুত্বপূর্ণ ও অপরিবর্তনীয় কাজ প্রকৃত কর্তৃত্বসহ একজন মানুষের পেছনে গেট করুন, এবং সস্তা ফেরানোর জন্য নকশা করুন।
  • এজেন্টকে বিরোধী গণ্য করুন: প্রম্পট ইনজেকশন ও কনফিউজড-ডেপুটি অপব্যবহারের বিরুদ্ধে প্রতিরক্ষা করুন (অধ্যায় 4.2)।
  • অনেক রান জুড়ে কাজ সাফল্য হারে মূল্যায়ন করুন, এবং ডিবাগিং, খরচ নিয়ন্ত্রণ ও নিরীক্ষার জন্য প্রতিটি রান ট্রেস করুন (অধ্যায় 6.5 ও 6.6)।
  • প্রায়ই সঠিক উত্তর আদৌ একটি এজেন্ট না গড়া।

তথ্যসূত্র ও আরও পড়ার জন্য

  • Shunyu Yao et al., ReAct: Synergising Reasoning and Acting in Language Models.
  • Timo Schick et al., Toolformer: Language Models Can Teach Themselves to Use Tools.
  • Anthropic, Building Effective Agents (engineering guidance on workflows versus agents).
  • OWASP Foundation, OWASP Top 10 for Large Language Model Applications (including prompt injection and excessive agency).
  • Simon Willison, writing on prompt injection and the “lethal trifecta” for AI agents.
  • Norman Hardy, The Confused Deputy (the classic statement of the confused-deputy problem).
  • Chip Huyen, AI Engineering: Building Applications with Foundation Models.
  • Stuart Russell ও Peter Norvig, Artificial Intelligence: A Modern Approach (intelligent agents and rational action).