6.3

View in English

6.3 জেনারেটিভ AI ও LLM অ্যাপ্লিকেশন

পরিচিতি ও প্রেরণা

জেনারেটিভ AI, এবং বিশেষত বড় ভাষা মডেল (LLM), প্রাকৃতিক-ভাষা নির্দেশ থেকে সাবলীল পাঠ্য, কোড, সারসংক্ষেপ এবং কাঠামোবদ্ধ ডেটা তৈরি করতে পারে। এটি সহকারী, অনুসন্ধান, নথি প্রক্রিয়াকরণ ও স্বয়ংক্রিয়তার জন্য এদের শক্তিশালী নির্মাণ-খণ্ড করে। কিন্তু সেই শক্তি একটি স্বতন্ত্র ঝুঁকি প্রোফাইল নিয়ে আসে। LLM সম্ভাব্যতামূলক। তারা আত্মবিশ্বাসী মিথ্যা (হ্যালুসিনেশন) তৈরি করতে পারে। আপনি কীভাবে প্রম্পট করেন তাতে তারা সংবেদনশীল। এবং তারা প্রম্পট ইনজেকশন (মডেলের আচরণ ছিনিয়ে নিতে ইনপুটে পাচার করা ক্ষতিকর নির্দেশ)-এর মতো নতুন আক্রমণ-পৃষ্ঠ খোলে। তাই নির্ভরযোগ্য LLM অ্যাপ্লিকেশন গড়া মডেলের চেয়ে তার চারপাশের প্রকৌশল নিয়ে বেশি: আপনি কীভাবে প্রসঙ্গ জোগান, উত্তর বিশ্বস্ত জ্ঞানে ভিত্তি করেন, আউটপুট সীমিত করেন এবং মান মূল্যায়ন করেন।

বড় দলের জন্য LLM অ্যাপ্লিকেশন ঐতিহ্যবাহী সফটওয়্যার ও ক্লাসিক্যাল মেশিন লার্নিং দুটি থেকেই ভিন্ন নতুন প্যাটার্ন দাবি করে। প্রায়ই কোনো প্রশিক্ষণ ধাপ থাকে না। বদলে আচরণ প্রম্পট, পুনরুদ্ধার করা প্রসঙ্গ, টুল সংজ্ঞা এবং গার্ডরেইল (মডেলের ইনপুট ও আউটপুট সীমিত করা রানটাইম পরীক্ষা) দ্বারা আকার পায়। এটি প্রকৌশল পরিশ্রমকে প্রসঙ্গ ব্যবস্থাপনা, পুনরুদ্ধার মান, অর্কেস্ট্রেশন ও মূল্যায়নের দিকে সরায়। পরিসরে LLM গ্রহণকারী এন্টারপ্রাইজের ভাগ করা প্যাটার্ন দরকার যাতে প্রতিটি দল কঠিন পথে একই ব্যর্থতা ধরন পুনরাবিষ্কার না করে।

সরকারি ও নিয়ন্ত্রিত প্রতিষ্ঠান অতিরিক্ত দাবির মুখোমুখি। যে LLM একটি নীতি উদ্ধৃতি বানায় বা সংবেদনশীল ডেটা ফাঁস করে তা নিছক বাগ নয়; তা একটি আইনি বা নিরাপত্তা ঘটনা হতে পারে। এই পরিবেশে কর্তৃত্বপূর্ণ উৎসে ভিত্তি, কঠোর আউটপুট যাচাই, গুরুত্বপূর্ণ আউটপুটের জন্য মানব তত্ত্বাবধান এবং সিস্টেমকে কী জিজ্ঞেস করা হয়েছিল ও সে কী তৈরি করেছে তার স্পষ্ট রেকর্ড দরকার। এই অধ্যায়ের কৌশল (পুনরুদ্ধার-বর্ধিত জেনারেশন, গার্ডরেইল ও কঠোর মূল্যায়ন) LLM-কে উচ্চ-ঝুঁকির প্রেক্ষাপটে ডিপ্লয় করার মতো যথেষ্ট নিরাপদ করে। Anthropic-এর Claude মডেল কয়েকটি সক্ষম প্রদানকারীর মধ্যে একটি শীর্ষ বিকল্প; আপনি যে মডেলই বাছুন, এখানকার চর্চা প্রযোজ্য।

মূল নীতিসমূহ

  • মডেল যা মুখস্থ করেছে তার ওপর নির্ভর না করে তাকে বিশ্বস্ত জ্ঞানে ভিত্তি করুন।
  • প্রম্পট ও প্রসঙ্গকে ফেলনা স্ট্রিং নয়, প্রকৌশলী, সংস্করণ করা নিদর্শন গণ্য করুন।
  • ধরে নিন মডেল ভুল বা কারসাজি হতে পারে; আউটপুট যাচাই করুন এবং কাজ সীমিত করুন।
  • ত্রুটি ও আক্রমণ-পৃষ্ঠ কমাতে মডেলকে কেবল যতটুকু প্রসঙ্গ ও টুল দরকার ততটুকুই দিন, এর বেশি নয়।
  • অফলাইন পরীক্ষা সেট, অনলাইন মেট্রিক ও মানব বিচার দিয়ে নিরন্তর মূল্যায়ন করুন।
  • গুরুত্বপূর্ণ আউটপুটের জন্য মানুষকে চক্রে রাখুন।
  • মডেলকে একটি বিশ্বস্ত সিস্টেমের ভেতরে একটি অবিশ্বস্ত উপাদান হিসেবে নকশা করুন।

সুপারিশ

প্রম্পট প্রকৌশল করুন এবং প্রসঙ্গ সুচিন্তিতভাবে পরিচালনা করুন

প্রম্পটকে কোডের মতো গণ্য করুন: সংস্করণ নিয়ন্ত্রণে সংরক্ষণ করুন, পরিবর্তন পর্যালোচনা করুন এবং উদাহরণের একটি স্যুটের বিপরীতে পরীক্ষা করুন। প্রতিটি প্রম্পট স্পষ্টভাবে গঠন করুন: ভূমিকা ও কাজ, সীমাবদ্ধতা, বিন্যাস প্রয়োজন এবং যেখানে সাহায্য করে সেখানে উদাহরণ। প্রসঙ্গ জানালা (মডেল একবারে বিবেচনা করতে পারে এমন পাঠ্যের স্থির বিস্তার)-কে দুর্লভ সম্পদ গণ্য করুন। সবচেয়ে প্রাসঙ্গিক তথ্য অন্তর্ভুক্ত করুন, সুচিন্তিতভাবে সাজান এবং গোলমাল ছাঁটুন, কারণ অপ্রাসঙ্গিক বা অতিরিক্ত প্রসঙ্গ মান নামায় ও খরচ বাড়ায়। বহু-পালা অ্যাপ্লিকেশনের জন্য কথোপকথন অবস্থা সুস্পষ্টভাবে পরিচালনা করুন, যা গুরুত্বপূর্ণ তা রেখে সীমার মধ্যে থাকতে ইতিহাস সংক্ষিপ্ত বা ছাঁটুন। একটি মডেল বদলানো মাত্র ভাঙা বিস্তৃত কৌশলের চেয়ে স্পষ্ট নির্দেশ ও few-shot উদাহরণ (প্রম্পটে অন্তর্ভুক্ত মুষ্টিমেয় কাজ-করা প্রদর্শন) পছন্দ করুন।

পুনরুদ্ধার-বর্ধিত জেনারেশন (RAG) দিয়ে উত্তর ভিত্তি করুন

জ্ঞান-নিবিড় কাজের জন্য একটি বিশ্বস্ত সংকলন থেকে প্রাসঙ্গিক নথি পুনরুদ্ধার করুন এবং মডেলকে প্রসঙ্গ হিসেবে দিন, তাকে কেবল সেই উপাদান থেকে উত্তর দিতে এবং উৎস উদ্ধৃত করতে বলে। RAG পুনঃপ্রশিক্ষণ ছাড়া জ্ঞান হালনাগাদ রাখে, উত্তর অনুমোদিত কনটেন্টে সীমিত করে এবং উদ্ধৃতি ও যাচাই সক্ষম করে। পুনরুদ্ধার মানে বিনিয়োগ করুন: নথি বোধগম্যভাবে খণ্ড করুন, আপনার ক্ষেত্রের সঙ্গে মানানসই এমবেডিং (সংখ্যাসূচক ভেক্টর উপস্থাপনা যা অনুরূপ অর্থ কাছাকাছি রাখে) বাছুন, এবং পুনরুদ্ধার করা অনুচ্ছেদে আসলে উত্তর আছে কি না পরীক্ষা করুন, কারণ ভুল অনুচ্ছেদে গড়া সাবলীল উত্তর কোনো উত্তর না থাকার চেয়েও খারাপ। এবং কিছুই প্রাসঙ্গিক না পাওয়া গেলে সিস্টেম কনটেন্ট উদ্ভাবনের বদলে তাই বলবে।

সংযমের সঙ্গে এজেন্ট ও টুল ব্যবহার গড়ুন

LLM টুল (অনুসন্ধান, ডেটাবেস, ক্যালকুলেটর, অভ্যন্তরীণ API) কল করতে পারে এবং একাধিক ধাপে পরিকল্পনা ও কাজ করা এজেন্টে রচিত হতে পারে। এটি প্রকৃত সামর্থ্য যোগ করে, কিন্তু ঝুঁকিও বহুগুণ করে: প্রতিটি টুল একটি ভুল বা কারসাজি করা মডেলের ক্ষতি করার আরেকটি উপায়। সুনির্দিষ্ট স্কিমাসহ টুল সংজ্ঞায়িত করুন, প্রতিটি আর্গুমেন্ট যাচাই করুন, ন্যূনতম বিশেষাধিকার প্রয়োগ করুন এবং যোগাযোগ পাঠানো বা অর্থ সরানোর মতো গুরুত্বপূর্ণ কাজের জন্য নিশ্চিতকরণ বা মানব অনুমোদন দাবি করুন। এজেন্ট লুপ সীমিত, পর্যবেক্ষণযোগ্য ও বাধাযোগ্য রাখুন। উন্মুক্ত-প্রান্ত স্বায়ত্তশাসনের দিকে হাত বাড়ানোর আগে আঁটো পরিসরের, একক-উদ্দেশ্য টুল দিয়ে শুরু করুন।

গার্ডরেইল যোগ করুন এবং আউটপুট যাচাই করুন

মডেলকে প্রতিরক্ষার স্তরে মুড়ুন। ভেতরের পথে ইনপুট ফিল্টার করুন এবং প্রম্পট ইনজেকশন শনাক্ত করুন, বিশেষত যখন অবিশ্বস্ত কনটেন্ট (ওয়েব পাতা, ব্যবহারকারী নথি) প্রসঙ্গে ঢোকে। বাইরের পথে একটি স্কিমার বিপরীতে কাঠামো যাচাই করুন, উৎসের বিপরীতে দাবি পরীক্ষা করুন, অনিরাপদ বা অসম্মত কনটেন্ট ফিল্টার করুন এবং যাচাই ব্যর্থ হলে প্রত্যাখ্যান বা পুনঃচেষ্টা করুন। কাঠামোবদ্ধ আউটপুটের জন্য মডেলের ফরম্যাটিংয়ে বিশ্বাসের বদলে পার্স ও যাচাই করুন। যাচাই ছাড়া কাঁচা মডেল আউটপুটকে অপরিবর্তনীয় কাজ ট্রিগার করতে কখনো দেবেন না। হ্যালুসিনেশন প্রশমনকে মডেল নিজে পরিচালনা করা কিছুর বদলে ভিত্তি, উদ্ধৃতি, যাচাই ও মানব পর্যালোচনার মাধ্যমে অর্জন করা একটি সিস্টেম বৈশিষ্ট্য গণ্য করুন।

অফলাইন, অনলাইন ও মানুষ দিয়ে মূল্যায়ন করুন

জানা-ভালো বা রুব্রিক-স্কোর করা আউটপুটসহ প্রতিনিধিত্বমূলক ইনপুটের একটি মূল্যায়ন স্যুট গড়ুন, এবং প্রতিটি প্রম্পট বা মডেল পরিবর্তনে চালান (অফলাইন মূল্যায়ন)। কাজ সাফল্য, এসকেলেশন হার ও ব্যবহারকারী প্রতিক্রিয়ার মতো মেট্রিক দিয়ে প্রোডাকশনে প্রকৃত আচরণ মাপুন (অনলাইন মূল্যায়ন)। বিষয়ীগত মানের জন্য মানব পর্যালোচক এবং, সতর্কভাবে, মডেল-ভিত্তিক গ্রেডিং ব্যবহার করুন। মূল্যায়ন সেই নিরাপত্তা জাল যা আপনাকে আত্মবিশ্বাসে প্রম্পট ও মডেল বদলাতে দেয়। এটি ছাড়া আপনি অন্ধভাবে উড়ছেন।

ট্রেড-অফ: সুবিধা ও অসুবিধা

পছন্দসুবিধাঅসুবিধাসবচেয়ে ভালো যখন
কেবল প্রম্পটিংসরল, দ্রুত, বদলানো সস্তাসীমিত ভিত্তি, হ্যালুসিনেট করতে পারেব্যাপক কাজ, কম ঝুঁকি
RAGবর্তমান, ভিত্তিযুক্ত, উদ্ধৃতিযোগ্যপুনরুদ্ধার সঠিক করা কঠিনজ্ঞান-ভারী, তথ্যভিত্তিক কাজ
টুলসহ এজেন্টশক্তিশালী, কাজ করতে পারেবড় আক্রমণ-পৃষ্ঠ, নিয়ন্ত্রণ কঠিনতরগার্ডরেইলসহ সুপরিসর স্বয়ংক্রিয়তা
বড়, শক্তিশালী মডেলভালো মান ও যুক্তিবেশি খরচ ও বিলম্বজটিল বা উচ্চ-ঝুঁকির কাজ
ছোট, সস্তা মডেলদ্রুত ও সাশ্রয়ীকঠিন কাজে দুর্বলতরউচ্চ পরিমাণ, সরল কাজ

কেন্দ্রীয় টানাপোড়েন সামর্থ্য বনাম নিয়ন্ত্রণ ও খরচ। আরও স্বায়ত্তশাসন ও বড় মডেল আরও মূল্য দেয়, কিন্তু আরও গার্ডরেইল, আরও মূল্যায়ন এবং আরও অর্থ দাবি করে। RAG-এর মাধ্যমে ভিত্তি পুনরুদ্ধার প্রকৌশলের খরচে বিশ্বস্ততা উন্নত করে। সঠিক ভারসাম্য ঝুঁকির ওপর নির্ভর করে: উচ্চ-ঝুঁকির অ্যাপ্লিকেশন ভিত্তি, যাচাই ও মানব তত্ত্বাবধানের দিকে ঝোঁকে, এমনকি যখন তা বেশি খরচ করে।

আপনার দলের সঙ্গে আলোচনার প্রশ্ন

  1. একটি LLM ফিচার জনগণের মুখোমুখি হওয়ার আগে কোন নির্ভুলতা ও ভিত্তি মান পূরণ করতে হবে, এবং কে অনুমোদন দেয়? ভুল উৎস উদ্ধৃত করা বা নীতি উদ্ভাবন করা সাবলীল উত্তর কোনো উত্তর না থাকার চেয়ে খারাপ, এবং সরকারে একটি বানানো উদ্ধৃতি বাগ নয়, আইনি ঘটনা। একটি বড় দলের জন্য একটি সুস্পষ্ট মান প্রতিটি গোষ্ঠীকে অনুভূতিতে নিজস্ব ব্যক্তিগত সীমা ঠিক করা থেকে ঠেকায়। আপনার “যথেষ্ট ভিত্তিযুক্ত”-র সংজ্ঞা আনুন: প্রতিটি দাবি একটি পুনরুদ্ধার করা, যাচাইকৃত উৎসে ট্রেস করতে হবে কি না, পুনরুদ্ধার খালি এলে সিস্টেম প্রত্যাখ্যান করবে কি না, এবং আপনার বিরোধী মূল্যায়ন সেট আসলে কী ঢাকে। লক্ষ করার সংকেত হলো রিগ্রেশন রান ছাড়া কেউ আজ ব্যবহারকারীদের কাছে সরাসরি একটি প্রম্পট পরিবর্তন পাঠাতে পারে কি না। ঝুঁকি আইনি বা নিরাপত্তা-সংক্রান্ত হলে উত্তর সবচেয়ে উচ্চ-ঝুঁকির আউটপুটকে প্রকাশের আগে প্রকৃত কর্তৃত্বসহ একজন মানব পর্যালোচকের মাধ্যমে রুট করা উচিত।

  2. আমাদের কোন LLM ফিচার গোপনে এজেন্ট, এবং প্রতিটি টুলকে কি ন্যূনতম বিশেষাধিকার এবং অপরিবর্তনীয় কাজে একটি মানব গেট দেওয়া হয়েছে? যে ফিচার মডেলকে টুল কল করতে বা একাধিক ধাপে কাজ করতে দেয় তা এজেন্ট এলাকায় ঢুকেছে, এবং প্রতিটি টুল একটি ভুল বা কারসাজি করা মডেলের ক্ষতি করার আরেকটি উপায়। অভ্যন্তরীণ API-তে LLM জোড়া এন্টারপ্রাইজের জন্য এই প্রশ্ন সেই ঝুঁকি তুলে ধরে যা একটি “সরল সহকারী” লেবেল লুকায়। মডেল ডাকতে পারে এমন প্রতিটি টুল, তার আর্গুমেন্ট যাচাই, তার বিশেষাধিকার পরিসর এবং কোন কাজ (যোগাযোগ পাঠানো, অর্থ সরানো, রেকর্ড বদলানো) নিশ্চিতকরণ দাবি করে তার একটি তালিকা আনুন। আলোচনা করুন এজেন্ট লুপ সীমিত, পর্যবেক্ষণযোগ্য ও বাধাযোগ্য কি না। উত্তর পরিসর আঁটো করা এবং যেখানে একটি গুরুত্বপূর্ণ বা অপরিবর্তনীয় কাজ বর্তমানে একটি ছাড়া পৌঁছানো যায় সেখানে মানব অনুমোদন গেট যোগ করা উচিত।

  3. একদিনের মধ্যে আমাদের পুনরুদ্ধার মান কমে গেছে কীভাবে জানব, যেহেতু ভুল অনুচ্ছেদে গড়া আত্মবিশ্বাসী উত্তর ঠিক দেখায়? RAG উত্তর বিশ্বস্ত করে কেবল যখন পুনরুদ্ধার আসলে উত্তর থাকা অনুচ্ছেদ তুলে ধরে, এবং নথি বদলালে, খণ্ড বাসি হলে বা এমবেডিং আপনার ক্ষেত্র থেকে সরলে পুনরুদ্ধার নীরবে পচে। কারণ মডেল খারাপ প্রসঙ্গের ওপর তবুও সাবলীল লেখে, ব্যবহারকারীরা আস্থা ইতিমধ্যে হারানো পর্যন্ত অভিযোগ নাও করতে পারে। আপনার বর্তমান পুনরুদ্ধার বিলম্ব ও রিকলের মাপ, পুনরুদ্ধার করা অনুচ্ছেদে সত্যিই উত্তর আছে কি না আপনি কীভাবে পরীক্ষা করেন, এবং সূচির সতেজতা নথি পরিবর্তনের সঙ্গে তাল রাখে কীভাবে আনুন। উচ্চ-ঝুঁকি বা জনসাধারণের ডিপ্লয়মেন্টের জন্য নিরীক্ষার জন্য পুনরুদ্ধার করা উৎস লগ করা আলোচনা করুন যাতে একটি খারাপ উত্তর তার খারাপ অনুচ্ছেদে ট্রেস করতে পারেন। আপনার কোনো পুনরুদ্ধার মূল্যায়ন না থাকলে আপনি বিশ্বাসে ভিত্তি করছেন।

  4. আমরা কি প্রম্পট, প্রসঙ্গ ও মূল্যায়ন সেটকে সংস্করণ করা, পর্যালোচিত নিদর্শন গণ্য করি, নাকি নোটবুক ও চ্যাট লগে ছড়ানো স্ট্রিং? প্রম্পট দল জুড়ে অসংস্করণ ও নকলভাবে ছড়ালে এক জায়গায় একটি সমাধান কখনো অন্যগুলোতে পৌঁছায় না, এবং গত ত্রৈমাসিকে সিস্টেমকে কী করতে বলা হয়েছিল কেউ পুনরুৎপাদন করতে পারে না। একটি বড় দলের জন্য একটি ভাগ করা প্রম্পট রেজিস্ট্রি এবং প্রতিটি পরিবর্তনে চলা একটি রিগ্রেশন স্যুট আপনাকে নিঃশব্দে দুই দল দূরের একটি ফিচার না ভেঙে একটি মডেল বদলাতে বা নির্দেশনা সম্পাদনা করতে দেয়। প্রতিদ্বন্দ্বী টান গতি: একটি প্রম্পট পেস্ট করে পাঠালে ইঞ্জিনিয়াররা দ্রুততম পুনরাবৃত্তি করে, তাই দ্রুত পরীক্ষা এবং ব্যবহারকারীদের ছোঁয়া যেকোনো কিছুর মধ্যে রেখা কোথায় একমত হোন। আপনার প্রম্পট আজ আসলে কোথায় থাকে, একটি মূল্যায়ন সেট পরিবর্তন গেট করে কি না, এবং আপনি প্রম্পটের পাশাপাশি পুনরুদ্ধার সংকলন কীভাবে সংস্করণ করেন আনুন। এন্টারপ্রাইজ ও সরকারি পরিবেশে নিরীক্ষা প্রয়োজন যোগ করুন: আপনাকে মাস পরে ঠিক কোন প্রম্পট ও কোন উৎস একটি নির্দিষ্ট আউটপুট তৈরি করেছিল দেখাতে হতে পারে, এবং আপনি পুনর্গঠন করতে পারেন না এমন প্রম্পট আপনি রক্ষা করতে পারেন না এমন রেকর্ড।

  5. পরিমাণ বাড়লে আমরা মান নীরবে না কমিয়ে অনুমান খরচ কীভাবে নিয়ন্ত্রণ করব, এবং মডেল-নির্বাচন সিদ্ধান্তের মালিক কে? LLM ফিচারের TCO প্রতি-কল অনুমান দ্বারা আধিপত্য পায়, এবং পাইলটে তুচ্ছ দেখানো খরচ প্রোডাকশন পরিসরে দ্রুত চক্রবৃদ্ধি হয়, দলগুলোকে নিঃশব্দে একটি দুর্বলতর মডেলে নামতে এবং কেউ মান পিছলানো লক্ষ না করার আশা করতে প্রলুব্ধ করে। একটি বড় প্রতিষ্ঠানের জন্য প্রতিটি দলকে অনুভূতিতে মডেল ও খরচ সীমা বাছতে দেওয়া অপ্রত্যাশিত বিল ও অসঙ্গত মান দুটিই তৈরি করে। প্রকৃত বিনিময় সামর্থ্য বনাম খরচ ও বিলম্ব: একটি বড় মডেল কঠিন কাজে ভালো যুক্তি করে, একটি ছোট সরল কাজে সস্তা ও দ্রুত, এবং ক্যাশিং, রুটিং ও পুনরুদ্ধার পরিসর সবই সংখ্যা সরায়। প্রতি সমাধান করা কাজে খরচ, আপনার মূল্যায়ন সেটে মডেল স্তর অনুযায়ী মান, এবং প্রম্পট বা প্রসঙ্গ ফোলা কোথায় টোকেন ব্যয় বাড়াচ্ছে আনুন। এন্টারপ্রাইজ ও সরকারি বাজেটে মডেল পছন্দ ও ব্যয় সীমা কে অনুমোদন করে তার নাম দিন, কারণ কেউ মালিক নয় এমন খরচ লাইন ট্রাফিক তিনগুণ হলে কেউ নিয়ন্ত্রণ করে না।

  6. কোন সংবেদনশীল ডেটা মডেলে পৌঁছাতে পারে, সেই ডেটা কোথায় যায়, এবং আমরা কি প্রমাণ করতে পারি তা সীমার ভেতরে ছিল? প্রতিটি প্রম্পট, পুনরুদ্ধার করা নথি এবং টুল ফল ব্যক্তিগত বা গোপনীয় ডেটা মডেলে এবং, একটি হোস্টেড প্রদানকারীর সঙ্গে, আপনার পরিসীমার বাইরে বহন করতে পারে, এবং এখানে একটি ফাঁস একটি আইনি বা নিরাপত্তা ঘটনা, ত্রুটি টিকিট নয়। অভ্যন্তরীণ সিস্টেমে LLM জোড়া একটি বড় দলের জন্য ঝুঁকি নলে লুকায়: একটি পুনরুদ্ধার সংকলন যাতে একজন নির্দিষ্ট ব্যবহারকারী কখনো দেখার কথা নয় এমন রেকর্ড আছে, বা কাঁচা ইনপুট ধরা লগ। টানাপোড়েন সামর্থ্য বনাম উন্মুক্ততা, কারণ সম্পাদনা ও আঁটো পরিসর আপনি যে ফিচার গড়ছেন তা ভোঁতা করতে পারে। প্রসঙ্গে কী ঢোকে তার একটি ডেটা-প্রবাহ মানচিত্র, প্রদানকারীর ধারণ ও প্রশিক্ষণ শর্ত, এবং আপনি সংবেদনশীল ক্ষেত্র কীভাবে সম্পাদনা, পরিসর ও লগ করেন আনুন। নিয়ন্ত্রিত ও সরকারি পরিবেশে এটি ডেটা-আবাসন নিয়ম, নথি-ধারণ কর্তব্য এবং বিক্রেতা আপনার ডেটা কীভাবে ব্যবহার করতে পারে তার চুক্তিগত সীমার সঙ্গে বাঁধুন, কারণ প্রমাণ করতে পারেন না এমন তত্ত্বাবধান আপনার নেই।

খাতভেদে দৃষ্টিভঙ্গি

স্টার্টআপ। আপনার মূল মূল্য ছোঁয়া একটি সংকীর্ণ LLM ফিচার পাঠান, আপনার নিজস্ব কনটেন্টের ওপর পুনরুদ্ধারসহ একটি হোস্টেড মডেলে গড়া, এবং প্রদানকারী বদলাতে পারার জন্য প্রম্পট একটি পাতলা ইন্টারফেসের পেছনে git-এ রাখুন। প্রতিটি পরিবর্তনের আগে প্রকৃত প্রশ্নের একটি ছোট মূল্যায়ন ফাইল চালান, প্রম্পট ইনজেকশন ভোঁতা করতে পেস্ট করা ব্যবহারকারী পাঠ্য ফিল্টার করুন, এবং মাসিক ব্যয় কঠোরভাবে সীমিত করুন। এজেন্ট ও সেলফ-হোস্টিং প্রতিরোধ করুন: আপনি তদারক করতে পারেন না এমন একটি অসীম টুল-কলিং লুপ একটি দায়, ডেমো নয়।

ছোট ব্যবসা। আপনার সম্ভবত কোনো ML বিশেষজ্ঞ নেই, তাই একটি বিল্ডে কর্মী দেওয়ার বদলে আপনি ইতিমধ্যে ব্যবহার করা টুলে এমবেড করা LLM ফিচার কিনুন। ঝুঁকিকে একটি সরল প্রশ্ন হিসেবে ফ্রেম করুন: একটি আত্মবিশ্বাসী ভুল উত্তর কোথায় আপনাকে একজন গ্রাহক খরচ করাবে, এবং বেরোনোর আগে আউটপুট কে পরীক্ষা করে। উৎস দেখায়, মানুষকে চক্রে রাখতে দেয় এবং ভুল আচরণ করলে AI বন্ধ করা সহজ করে এমন বিক্রেতা পছন্দ করুন।

এন্টারপ্রাইজ। সমস্যা অনেক দল জুড়ে পরিসর: RAG, গার্ডরেইল ও টুল স্কিমার ভাগ করা প্যাটার্ন প্রকাশ করুন, সঙ্গে একটি সাধারণ মূল্যায়ন হার্নেস ও প্রম্পট রেজিস্ট্রি যাতে প্রতিটি গোষ্ঠী একই ব্যর্থতা ধরন পুনরাবিষ্কার বন্ধ করে। অনুমান খরচ ও মানব পর্যালোচনা সুস্পষ্টভাবে বাজেট করুন, ইন্টারফেস স্তর প্রমিত করুন যাতে মডেল বদলানো যায়, এবং ন্যূনতম বিশেষাধিকার, সীমিত লুপ ও নিরীক্ষা লগিংসহ এজেন্ট কেন্দ্রীয়ভাবে শাসন করুন। LLM ফিচার পাইলটের ছড়ানোর বদলে মেট্রিক ও মেরে-ফেলার মানদণ্ডসহ পোর্টফোলিও হিসেবে পরিচালনা করুন।

সরকার। স্বচ্ছতা, ক্রয় নিয়ম ও জবাবদিহি প্রতিটি পছন্দ আকার দেয়। উদ্ধৃতিসহ অনুমোদিত উৎসে কঠোরভাবে ভিত্তি করুন, পুনরুদ্ধার খালি এলে প্রত্যাখ্যান করুন, এবং মডেলকে সে উদ্ধৃত করতে পারে না এমন আইন বলতে নিষেধ করুন। গুরুত্বপূর্ণ আউটপুট পর্যালোচনা করতে একজন জবাবদিহিযোগ্য কর্মকর্তাকে রাখুন, নিরীক্ষার জন্য ইনপুট ও পুনরুদ্ধার করা উৎস লগ করুন, প্রতিটি রিলিজের আগে একটি বিরোধী মূল্যায়ন সেট চালান এবং চুক্তিতে মডেল সীমাবদ্ধতা ও ডেটা-পরিচালনা শর্তের প্রকাশ দাবি করুন।

উদাহরণ

স্টার্টআপ। তিনজনের একটি ডেভেলপার-টুল স্টার্টআপ তার নিজস্ব ডক্সের ওপর একটি চ্যাট সহায়ক যোগ করে যাতে ব্যবহারকারীরা মৌলিক প্রশ্নের জন্য ইমেইল করা বন্ধ করে। এটি RAG ব্যবহার করে যাতে প্রতিটি উত্তর একটি নির্দিষ্ট ডক পাতা উদ্ধৃত করে, পুনরুদ্ধার খালি এলে মডেলকে “আমি নিশ্চিত নই, এখানে জিজ্ঞেস করুন” বলতে নির্দেশ দেয়, এবং তার প্রম্পট git-এ রাখে। প্রতিটি পরিবর্তনের আগে রিগ্রেশন ধরতে প্রকৃত ব্যবহারকারী প্রশ্নের একটি ছোট ফাইলের বিপরীতে প্রম্পট চালায়, এবং প্রম্পট ইনজেকশন ভোঁতা করতে ব্যবহারকারী-পেস্ট করা পাঠ্য ফিল্টার করে। সহায়ক সাধারণ প্রশ্ন সামলায় এবং বাকিগুলো নিঃশব্দে প্রতিষ্ঠাতাদের ভাগ করা ইনবক্সে পাঠায়।

এন্টারপ্রাইজ। একটি সফটওয়্যার কোম্পানি তার পণ্য নথির ওপর একটি অভ্যন্তরীণ সহায়তা সহকারী গড়ে। এটি RAG ব্যবহার করে যাতে উত্তর নির্দিষ্ট ডক পাতা উদ্ধৃত করে, পুনরুদ্ধার ব্যর্থ হলে মডেলকে “আমি জানি না” বলতে বলে, এবং যাচাই করে প্রতিটি উদ্ধৃত উৎস আসলে অস্তিত্বশীল। প্রম্পট সংস্করণ-নিয়ন্ত্রিত এবং প্রতিটি পরিবর্তনে প্রকৃত সহায়তা প্রশ্নের একটি স্যুটের বিপরীতে পরীক্ষিত। সহকারী নিয়মিত টিকিট বিক্ষিপ্ত করে এবং নিম্ন-আস্থার সবকিছু মানব এজেন্টদের কাছে এসকেলেট করে, যখন অনলাইন মেট্রিক সমাধান ও সংশোধন হার অনুসরণ করে।

সরকার। একটি সরকারি সংস্থা কর্মীদের নাগরিক অনুসন্ধানের উত্তর খসড়া করতে সাহায্য করতে একটি LLM সহকারী ডিপ্লয় করে। ভিত্তি কঠোর ছিল: মডেল কেবল উদ্ধৃতিসহ অনুমোদিত নির্দেশনা থেকে উত্তর রচনা করতে পারত, এবং পুনরুদ্ধার করা উৎসে উপস্থিত নয় এমন নীতি বলা তার জন্য নিষিদ্ধ ছিল। একজন জবাবদিহিযোগ্য কর্মকর্তা প্রতিটি খসড়া বেরোনোর আগে পর্যালোচনা করতেন। ইনপুট ফিল্টারিং নাগরিক-জমা দেওয়া নথি থেকে প্রম্পট ইনজেকশনের বিরুদ্ধে পাহারা দিত, আউটপুট নিরীক্ষার জন্য লগ করা হতো, এবং বিরোধী ও প্রান্তিক-কেস কোয়েরির একটি মূল্যায়ন সেট প্রতিটি রিলিজের আগে চলত নিশ্চিত করতে সিস্টেম আইনের বিষয়ে অনুমান করতে প্রত্যাখ্যান করে।

ব্যবসায়িক যুক্তি: প্রেরণা, ROI ও TCO

LLM অ্যাপ্লিকেশন ভাষা-ভারী কাজ স্বয়ংক্রিয় করে ROI দেয়: প্রশ্নের উত্তর, নথি সংক্ষেপ, কনটেন্ট খসড়া এবং অকাঠামোবদ্ধ পাঠ্য থেকে কাঠামো বের করা। মূল্য দেখা দেয় বিক্ষিপ্ত টিকিট, দ্রুততর খসড়া, কম ম্যানুয়াল পর্যালোচনা এবং নতুন স্ব-সেবা সামর্থ্য হিসেবে। কারণ প্রায়ই কোনো প্রশিক্ষণ ধাপ থাকে না, প্রথম মূল্যে সময় ছোট, একটি বড় আকর্ষণ।

তবে TCO চলমান অনুমান খরচ, পুনরুদ্ধার অবকাঠামো, মূল্যায়ন পাইপলাইন, গার্ডরেইল সিস্টেম এবং মানব পর্যালোচনা দ্বারা আধিপত্য পায়। প্রতি-কল খরচ পরিসরে দ্রুত যোগ হয়, এবং একটি অপর্যবেক্ষিত অ্যাপ্লিকেশন অনিরাপদ বা ব্যয়বহুল আচরণে সরতে পারে। গ্রহণ না করার খরচ সেবা মান ও কর্মী উৎপাদনশীলতায় পিছিয়ে পড়া। অসাবধানে গ্রহণ করার খরচ একটি জনসম্মুখ হ্যালুসিনেশন ঘটনা বা ডেটা ফাঁস। একটি সুনির্দিষ্ট উৎপাদনশীলতা লক্ষ্যকে একটি সুনির্দিষ্ট নিরাপত্তা ও মূল্যায়ন পরিকল্পনার সঙ্গে জোড়া দিয়ে, এবং মূল্য টেকসই রাখা গার্ডরেইল ও মানব তত্ত্বাবধানের জন্য বাজেট করে নেতৃত্বের কাছে যুক্তি দিন।

অ্যান্টি-প্যাটার্ন ও ফাঁদ

  • সাবলীল আউটপুটে বিশ্বাস। আত্মবিশ্বাসী, সুলিখিত পাঠ্যকে সঠিক পাঠ্য ভুল করা।
  • পুনরুদ্ধার মূল্যায়ন ছাড়া RAG। পুনরুদ্ধার কাজ করে ধরে নেওয়া এবং সঠিক অনুচ্ছেদ তুলে ধরে কি না কখনো না দেখা।
  • প্রম্পট ইনজেকশন অন্ধত্ব। প্রতিরক্ষা ছাড়া অবিশ্বস্ত কনটেন্ট প্রম্পটে খাওয়ানো।
  • সীমাহীন এজেন্ট। সীমা বা মানব অনুমোদন ছাড়া এজেন্টকে গুরুত্বপূর্ণ কাজ করতে দেওয়া।
  • মূল্যায়ন হার্নেস নেই। রিগ্রেশন টেস্টিং ছাড়া অনুভূতিতে প্রম্পট ও মডেল বদলানো।
  • প্রম্পট বিস্তার। দল জুড়ে ছড়ানো, অসংস্করণ ও নকল প্রম্পট।
  • অতি-স্বয়ংক্রিয়তা। আইনি বা নিরাপত্তা ওজন বহনকারী সিদ্ধান্ত থেকে মানুষ সরানো।

পরিপক্বতা মডেল

  1. সূচনা। বিচ্ছিন্ন প্রকল্পে অ্যাড হক প্রম্পটিং; কোনো ভিত্তি, গার্ডরেইল বা মূল্যায়ন নেই; প্রম্পট যেখানে কেউ পেস্ট করেছে সেখানেই থাকে, এবং হ্যালুসিনেশন প্রোডাকশনে আবিষ্কৃত হয়।
  2. বিকাশ। কিছু দল RAG ও প্রম্পট সংস্করণ, মৌলিক আউটপুট যাচাই এবং একটি ছোট ম্যানুয়াল মূল্যায়ন সেট যোগ করে, কিন্তু চর্চা দল অনুযায়ী ভিন্ন এবং ভাগ করা প্রত্যাশার বদলে ব্যক্তিগত চ্যাম্পিয়নের ওপর দাঁড়ায়।
  3. মানসম্মতকরণ। RAG, গার্ডরেইল, টুল স্কিমা ও প্রম্পট সংস্করণের নথিবদ্ধ প্যাটার্ন প্রতিষ্ঠান-ব্যাপী প্রয়োগ করা; স্বয়ংক্রিয় অফলাইন মূল্যায়ন প্রতিটি প্রম্পট বা মডেল পরিবর্তনে চলে; উচ্চ-ঝুঁকির প্রবাহ অনলাইন মেট্রিক ও মানব পর্যালোচনা বহন করে।
  4. ব্যবস্থাপনা। পোর্টফোলিও ভিত্তিরেখার বিপরীতে মাপা: পুনরুদ্ধার রিকল, হ্যালুসিনেশন ও প্রত্যাখ্যান হার, ইনজেকশন-প্রতিরক্ষা কভারেজ, প্রতি-কল খরচ ও বিলম্ব, এবং এসকেলেশন ও সংশোধন হার ড্যাশবোর্ডে অনুসরণ করা; রিলিজ গেট ও মেরে-ফেলার মানদণ্ড মতামতের বদলে প্রমাণে ফায়ার করে, এবং একটি রিগ্রেশন রান একটি মেট্রিক ভুল দিকে সরানো যেকোনো পরিবর্তন আটকায়।
  5. সমন্বয়। নিরন্তর অফলাইন ও অনলাইন মূল্যায়ন ব্যবসায়িক ফলাফলের সঙ্গে বাঁধা; ইনজেকশন প্রতিরক্ষা, এজেন্ট ও ভিত্তি শাসিত ও পর্যবেক্ষণযোগ্য; প্রতিষ্ঠান নিয়মিত LLM ফিচার অবসর, পুনঃটিউন ও পুনর্নির্ধারণ করে, এবং মান, খরচ ও ঝুঁকি সরলে মডেল বদলায়।

আলোচনার ভাবনা

  • কোন আউটপুট ব্যবহারের আগে মানব পর্যালোচনা দাবি করে তা আপনি কীভাবে ঠিক করেন?
  • একটি উত্তর ব্যবহারকারীদের দেখানোর আগে “যথেষ্ট ভিত্তিযুক্ত”-র জন্য আপনার মান কী?
  • অবিশ্বস্ত কনটেন্ট প্রসঙ্গে ঢুকতেই হলে আপনি প্রম্পট ইনজেকশনের বিরুদ্ধে কীভাবে প্রতিরক্ষা করেন?
  • একটি সরল, একক-কল নকশার বিপরীতে একটি এজেন্ট কখন তার বাড়তি ঝুঁকির যোগ্য?
  • মডেল-ভিত্তিক গ্রেডিংয়ের ওপর অতি-নির্ভর না হয়ে আপনি পরিসরে বিষয়ীগত মান কীভাবে মূল্যায়ন করেন?
  • অনেক দল জুড়ে আপনি প্রম্পট রক্ষণাবেক্ষণযোগ্য ও সামঞ্জস্যপূর্ণ কীভাবে রাখেন?

প্রধান শিক্ষা

  • নির্ভরযোগ্যতা আসে মডেলের চারপাশের প্রকৌশল থেকে: প্রসঙ্গ, ভিত্তি, গার্ডরেইল ও মূল্যায়ন।
  • RAG উত্তর বিশ্বস্ত উৎসে ভিত্তি করে এবং উদ্ধৃতি ও যাচাই সক্ষম করে।
  • মডেলকে অবিশ্বস্ত উপাদান গণ্য করুন; আউটপুট যাচাই করুন এবং টুল ব্যবহার সীমিত করুন।
  • এজেন্টকে ন্যূনতম বিশেষাধিকার, সীমিত লুপ এবং গুরুত্বপূর্ণ কাজের জন্য মানব অনুমোদন দিন।
  • অফলাইন, অনলাইন ও মানুষ দিয়ে নিরন্তর মূল্যায়ন করুন; এটিই পরিবর্তন নিরাপদ করে।

তথ্যসূত্র ও আরও পড়ার জন্য

  • Patrick Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.
  • Jason Wei et al., Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.
  • OWASP Foundation, OWASP Top 10 for Large Language Model Applications.
  • Chip Huyen, AI Engineering: Building Applications with Foundation Models.
  • Anthropic, Building Effective Agents (engineering guidance).
  • Louis-François Bouchard ও Louie Peters, Building LLMs for Production.