6.8

View in English

6.8 AI মূল্যায়ন ও টেস্টিং

পরিচিতি ও প্রেরণা

সাধারণ সফটওয়্যার টেস্টিং একটি আরামদায়ক অনুমানের ওপর দাঁড়ায়: একই ইনপুট দিলে প্রোগ্রাম একই আউটপুট ফেরত দেয়, এবং আপনি ঠিক দাবি করতে পারেন সেই আউটপুট কী হওয়া উচিত। কৃত্রিম বুদ্ধিমত্তা সেই অনুমান ভাঙে। একটি মডেল একই প্রশ্নের দুটি ভিন্ন উপায়ে উত্তর দিতে পারে, দুটিই গ্রহণযোগ্য। এটি পাস বা ব্যর্থের বদলে ভুল থেকে উজ্জ্বল পর্যন্ত একটি বর্ণালীতে গ্রেড হতে পারে। এবং দাবি করার মতো একক সঠিক উত্তর প্রায়ই থাকে না। তাই মূল্যায়নের শৃঙ্খলা, একটি আউটপুট একটি প্রত্যাশিত মানের বিপরীতে পরীক্ষা না করে অনেক প্রতিনিধিত্বমূলক কেস জুড়ে একটি মডেল কতটা ভালো আচরণ করে তা মাপা, যেকোনো বিশ্বস্ত AI সিস্টেমের মেরুদণ্ড হয়ে ওঠে। দলগুলো যখন নিজেদের বিব্রত করা AI ফিচার পাঠায়, মূল কারণ প্রায় সবসময় রিলিজের আগে মান মাপার কোনো গুরুতর উপায় না থাকা।

বড় দলের জন্য মূল্যায়ন পরিবর্তন নিরাপদ করে। আপনি মডেল বদলাবেন, প্রম্পট পুনর্লিখন করবেন, পুনরুদ্ধার টিউন করবেন এবং টুল যোগ করবেন, এবং এর প্রতিটি পরিবর্তন আপনি শক্ত ভেবেছিলেন এমন আচরণ নীরবে অবনত করতে পারে। মান মাপার একটি পুনরাবৃত্তিযোগ্য উপায় ছাড়া প্রতিটি পরিবর্তন একটি জুয়া এবং প্রতিটি রিগ্রেশন একজন ব্যবহারকারী আবিষ্কার করে। এই অধ্যায় নির্মাণ অধ্যায়গুলোর পরিমাপ সঙ্গী: জেনারেটিভ AI ও LLM অ্যাপ্লিকেশন (অধ্যায় 6.3), AI এজেন্ট ও এজেন্টিক সিস্টেম (অধ্যায় 6.7), এবং মেশিন লার্নিং প্রকৌশল ও MLOps (অধ্যায় 6.2)। এটি আপনার সাধারণ টেস্টিং কৌশল (অধ্যায় 2.4)-কে সম্ভাব্যতামূলক জগতে প্রসারিত করে।

এন্টারপ্রাইজ ও সরকারি পরিবেশ ঝুঁকি আরও বাড়ায়। ডজন ডজন AI ফিচার চালানো একটি এন্টারপ্রাইজের একটি ভাগ করা মূল্যায়ন প্ল্যাটফর্ম দরকার যাতে প্রতিটি দল স্ক্র্যাচ থেকে গ্রেডিং পুনরাবিষ্কার না করে। একটি সরকারি সংস্থার নথিবদ্ধ ও নিরীক্ষণযোগ্য মূল্যায়ন দরকার, কারণ “আমরা এটি পরীক্ষা করেছি” কে “এই যে প্রমাণ, ডেটাসেট, মেট্রিক এবং অনুমোদন” হতে হবে। মূল্যায়ন সেই জায়গা যেখানে দায়িত্বশীল ও বিশ্বস্ত AI (অধ্যায় 6.5) একটি মূল্যবোধ বিবৃতি থাকা বন্ধ করে আপনি একজন নিয়ন্ত্রককে দেখাতে পারেন এমন কিছু হয়ে ওঠে।

মূল নীতিসমূহ

  • মূল্যায়নকে লঞ্চের আগে জুড়ে দেওয়া পরের ভাবনার বদলে প্রথম-শ্রেণির পণ্য গণ্য করুন।
  • মডেলকে তোষামোদ করা খেলনা উদাহরণের বদলে প্রকৃত ব্যবহার প্রতিফলিত করা প্রতিনিধিত্বমূলক ডেটা দিয়ে মাপুন।
  • দ্রুত পুনরাবৃত্তির জন্য অফলাইন মূল্যায়ন এবং মূল সত্যের জন্য অনলাইন মূল্যায়ন মেশান।
  • মানব বিচারকে আপনার নোঙর করুন, এবং প্রতিটি স্বয়ংক্রিয় গ্রেডার তার বিপরীতে ক্যালিব্রেট করুন।
  • আপনার মূল্যায়ন সেট দূষণ থেকে রক্ষা করুন, নইলে আপনার সংখ্যা আপনাকে মিথ্যা বলবে।
  • মূল্যায়ন নিরন্তর ইন্টিগ্রেশনে গেট হিসেবে জুড়ুন, যাতে মান নীরবে পিছলে যায় না।
  • প্রোডাকশনে মাপতে থাকুন, কারণ আপনার কোড না বদলালেও মান সরে।

সুপারিশ

eval-চালিত উন্নয়ন গ্রহণ করুন

প্রম্পট টিউন বা মডেল বাছার আগে মূল্যায়ন লিখুন। এটি টেস্ট-চালিত উন্নয়নের প্রতিফলন: আপনি পরিমাপযোগ্য ভাষায় “ভালো” মানে কী সংজ্ঞায়িত করেন, তারপর সেদিকে গড়েন। এখানে একটি মূল্যায়ন মানে প্রতিটি আউটপুটের জন্য একটি সংখ্যা বা গ্রেড ফেরত দেওয়া একটি স্কোরিং পদ্ধতির সঙ্গে জোড়া ইনপুটের একটি ডেটাসেট। ছোট শুরু করুন। প্রকৃত ব্যবহারকারী অভিপ্রায় প্রতিফলিত করা কুড়িটি সতর্কভাবে বাছা কেস হাজারটি এলোমেলোকে হারায়। সিস্টেম কোথায় ব্যর্থ হয় শেখার সঙ্গে সেট বাড়ান, প্রতিটি প্রোডাকশন ব্যর্থতা একটি স্থায়ী কেস হিসেবে ফিরিয়ে যোগ করে যাতে একই ভুল অলক্ষিত ফিরতে না পারে।

eval-চালিত উন্নয়ন দলের আচরণ বদলায়। যখন ভালোর সংজ্ঞা লিখিত ও চালানোযোগ্য, একটি পরিবর্তন সাহায্য করেছে কি না নিয়ে তর্ক রুচির বিষয়ের বদলে পরীক্ষাযোগ্য হয়। eval সেটকে সংস্করণ নিয়ন্ত্রণে একটি পর্যালোচিত নিদর্শন করুন, ঠিক সেই প্রম্পট ও কোডের পাশে যা এটি মাপে।

অফলাইন ও অনলাইন মূল্যায়ন আলাদা করুন, এবং দুটিই ব্যবহার করুন

অফলাইন মূল্যায়ন একটি নিয়ন্ত্রিত পরিবেশে আপনার সিস্টেমের মধ্য দিয়ে একটি নির্দিষ্ট ডেটাসেট চালায়, দ্রুত, সস্তা ও পুনরাবৃত্তিযোগ্য, যাতে কিছু পাঠানোর আগে আপনি সংস্করণ তুলনা করতে পারেন। অনলাইন মূল্যায়ন কাজ সমাপ্তি, এসকেলেশন হার, থাম্বস-আপ ও থাম্বস-ডাউন প্রতিক্রিয়া এবং নিম্নধারা ব্যবসায়িক ফলের মতো মেট্রিক দিয়ে প্রকৃত ব্যবহারকারীদের সঙ্গে লাইভ সিস্টেম মাপে। অফলাইন বলে একটি পরিবর্তন নিরাপদ হওয়ার সম্ভাবনা আছে কি না; অনলাইন বলে এটি আসলে কাজ করেছে কি না। আপনার দুটিই দরকার, কারণ অফলাইন সেট কখনো বাস্তবতা পুরোপুরি ধরে না এবং অনলাইন সংকেত আপনার একমাত্র গার্ডরেইল হতে অনেক দেরিতে আসে।

দুটিকে একটি চক্রে জুড়ুন। অনলাইন মেট্রিক কমলে বা ব্যবহারকারী একটি খারাপ উত্তর চিহ্নিত করলে সেই কেস ধরুন, লেবেল করুন এবং অফলাইন সেটে ভাঁজ করুন। পরীক্ষা সেই একই নিয়ন্ত্রিত তুলনার মাধ্যমে চালান যা আপনি যেকোনো পণ্য পরিবর্তনে ব্যবহার করেন, যা পণ্য বিশ্লেষণ ও পরীক্ষার (অধ্যায় 7.4) এলাকা। একটি নতুন মডেল কাজ সাফল্য বাড়ায় দেখানো একটি A/B টেস্ট যেকোনো অফলাইন স্কোরের চেয়ে বেশি মূল্যবান, তবু অফলাইন স্কোরই আপনাকে টেস্ট চালানোর সাহস দিয়েছে।

প্রতিনিধিত্বমূলক eval সেট গড়ুন এবং দূষণের বিরুদ্ধে রক্ষা করুন

আপনার মূল্যায়ন কেবল তার ডেটার মতোই সৎ। গোল্ডেন ডেটাসেট গড়ুন, যাচাইকৃত প্রত্যাশিত আউটপুট বা স্কোরিং রুব্রিকসহ ইনপুটের সংগ্রহ, যা ব্যবহারকারীরা আসলে যা জিজ্ঞেস করে তার প্রকৃত বিতরণ প্রতিফলিত করে: সাধারণ কেস, বিরল-কিন্তু-জটিল কেস, বিরোধী কেস এবং আপনার সিস্টেম বর্তমানে ভুল করে এমন কেস। সেগুলো স্তরে ভাগ করুন যাতে আপনি একটি সুস্থ গড়ের ভেতরে একটি ব্যর্থ শ্রেণি লুকানোর বদলে প্রতি-বিভাগে মান পড়তে পারেন। ডোমেইন বিশেষজ্ঞদের প্রত্যাশিত উত্তর যাচাই করান, কারণ ভুল উত্তরে গড়া একটি গোল্ডেন সেট কোনোটি না থাকার চেয়ে খারাপ।

তারপর সেই ডেটা দূষণ থেকে রক্ষা করুন। টেস্ট-সেট দূষণ ঘটে যখন আপনার মূল্যায়ন উদাহরণ একটি মডেলের প্রশিক্ষণ ডেটায় বা প্রম্পটেই ফাঁস হয়, তাই মডেল ভালো কাজ করছে মনে হয় কারণ সে কার্যত উত্তর দেখেছে। এজন্যই একটি মডেল একটি পাবলিক বেঞ্চমার্কে উজ্জ্বল স্কোর করে এবং আপনার প্রকৃত ট্রাফিকে হোঁচট খেতে পারে। আপনার eval ডেটার একটি অংশ ব্যক্তিগত রাখুন এবং বিশ্বাস করতে পারেন না এমন তৃতীয় পক্ষকে কখনো পাঠাবেন না। সময়ের সঙ্গে সেট সতেজ করুন। সূক্ষ্মতর ফাঁস থেকে সতর্ক থাকুন যেখানে ডেভেলপাররা স্কোর অর্থহীন না হওয়া পর্যন্ত eval সেটের বিপরীতে প্রম্পট হাতে টিউন করে, প্রকৃত উন্নতির বদলে টেস্টে ওভারফিটিংয়ের একটি রূপ। আপনি কেবল মাঝে মাঝে দেখেন এমন একটি নতুন সেট আলাদা রাখুন।

কাজের সঙ্গে মানানসই মেট্রিক বাছুন

আপনার পরিমাপ আউটপুটের আকারের সঙ্গে মেলান। শ্রেণিবিন্যাস ও নিষ্কাশনের জন্য, যেখানে একটি সঠিক লেবেল আছে, ক্লাসিক মেট্রিক প্রযোজ্য: প্রিসিশন ও রিকল (আপনি যা চিহ্নিত করেছেন তার কতটা সঠিক ছিল, এবং সঠিক আইটেমের কতটা আপনি পেয়েছেন), সেগুলো ভারসাম্য করা F-স্কোর, এবং সঠিক-মিল নির্ভুলতা। যেকোনো কিছুর জন্য যেখানে একটি আত্মবিশ্বাসী সম্ভাবনা গুরুত্বপূর্ণ, ক্যালিব্রেশন মাপুন, একটি ঘোষিত ৮০ শতাংশ আস্থা প্রায় ৮০ শতাংশ সময় সঠিক কি না, কারণ একটি সুক্যালিব্রেট করা মডেল যে জানে কখন সে অনিশ্চিত তা একটি অতি-আত্মবিশ্বাসীর চেয়ে অনেক নিরাপদ।

জেনারেটিভ আউটপুট কঠিনতর। BLEU ও ROUGE-এর মতো রেফারেন্স-ভিত্তিক মেট্রিক, মূলত যন্ত্র অনুবাদ ও সংক্ষেপনের জন্য গড়া, ওভারল্যাপিং শব্দ ও বাক্যাংশ গুনে তৈরি পাঠ্যকে রেফারেন্স পাঠ্যের সঙ্গে তুলনা করে। এগুলো সস্তা ও পুনরাবৃত্তিযোগ্য, এবং মানের দুর্বল প্রক্সি: এগুলো পৃষ্ঠের ওভারল্যাপকে পুরস্কৃত করে এবং রেফারেন্স থেকে ভিন্নভাবে বলা একটি সঠিক উত্তরকে শাস্তি দেয়। এগুলো স্থূল রিগ্রেশন সংকেত হিসেবে ব্যবহার করুন, ভালোর আপনার সংজ্ঞা হিসেবে নয়। উন্মুক্ত-প্রান্ত কাজের জন্য রুব্রিক-ভিত্তিক স্কোরিং ভালো কাজ করে: স্পষ্ট মানদণ্ড সংজ্ঞায়িত করুন (এটি কি ভিত্তিযুক্ত, সম্পূর্ণ, নিরাপদ এবং সঠিকভাবে বিন্যস্ত) এবং প্রতিটি স্কোর করুন। রুব্রিক বিষয়ীগত মানকে পাঠযোগ্য ও পর্যালোচনাযোগ্য করে।

LLM-অ্যাজ-এ-জাজ ব্যবহার করুন, কিন্তু মানুষের বিপরীতে ক্যালিব্রেট করুন

জেনারেটিভ আউটপুট হাতে গ্রেড করা স্কেল করে না, তাই দলগুলো ক্রমশ একটি শক্তিশালী বড় ভাষা মডেল স্বয়ংক্রিয় বিচারক হিসেবে ব্যবহার করে, ইনপুট, আউটপুট ও একটি রুব্রিক দিয়ে প্রম্পট করে এবং স্কোর করতে বলে। এই LLM-অ্যাজ-এ-জাজ পদ্ধতি দ্রুত এবং বিস্ময়করভাবে সক্ষম, এবং এতে প্রকৃত পক্ষপাত আছে যা আপনাকে পরিচালনা করতে হবে। বিচারকরা দীর্ঘতর উত্তর পছন্দ করে, একটি জোড়া তুলনায় প্রথম দেখানো বিকল্পের পক্ষ নেয় (অবস্থান পক্ষপাত), তাদের নিজস্ব লেখার ধরন পুরস্কৃত করে, এবং সাবলীল কিন্তু ভুল যুক্তিতে প্রভাবিত হতে পারে। অনিয়ন্ত্রিত থাকলে একটি পক্ষপাতী বিচারক আপনাকে আত্মবিশ্বাসী, নির্ভুল, ভুল সংখ্যা দেয়।

বিচারককে মানব লেবেলের বিপরীতে ক্যালিব্রেট করুন। মানুষকে একটি নমুনা গ্রেড করান, তারপর মডেল বিচারক তাদের সঙ্গে কতটা একমত পরীক্ষা করুন, এবং বিশ্বাস করার মতো যথেষ্ট উচ্চ একমত না হওয়া পর্যন্ত বিচারক প্রম্পট টিউন করতে থাকুন। জানা পক্ষপাত সুচিন্তিতভাবে কমান: বিকল্পের ক্রম এলোমেলো করুন, দৈর্ঘ্য নিয়ন্ত্রণ করুন, এবং একটি নগ্ন সংখ্যার বদলে কারণসহ রুব্রিক-নোঙর করা স্কোর চান। বিচারককে একটি নির্দিষ্ট ওরাকলের বদলে পর্যায়ক্রমিক পুনঃক্যালিব্রেশন দরকার এমন একটি পরিমাপ যন্ত্র গণ্য করুন। বিচারক গড়ার সময় উপলব্ধ সবচেয়ে সক্ষম মডেলে ডিফল্ট করুন, কারণ একটি দুর্বল বিচারক একটি দুর্বল ফিতা।

মূল সত্যের জন্য মানুষকে চক্রে রাখুন

মানব মূল্যায়ন সেই নোঙর যার বিপরীতে প্রতিটি স্বয়ংক্রিয় মেট্রিক মাপা হয়, তাই এটি ভালোভাবে করতে বিনিয়োগ করুন। স্পষ্ট টীকা নির্দেশিকা লিখুন, আপনার টীকাকারদের প্রশিক্ষণ দিন, এবং আন্তঃটীকাকার একমত মাপুন, স্বাধীন পর্যালোচকরা একই কেসকে একই গ্রেড দেওয়ার মাত্রা। কম একমত সাধারণত বোঝায় আপনার রুব্রিক অস্পষ্ট, আপনার পর্যালোচকরা অসাবধান নয়, তাই রুব্রিক সারান। উচ্চ-ঝুঁকির ক্ষেত্রের জন্য একটি আইনি বা চিকিৎসা উত্তর বিচার করার প্রসঙ্গ নেই এমন ভিড়-কর্মীদের বদলে যোগ্য বিশেষজ্ঞ ব্যবহার করুন।

নিরাপত্তা ও বিরোধী দৃঢ়তার জন্য রেড-টিম করুন

প্রমিত eval সেট মাপে সিস্টেম যুক্তিসঙ্গত ইনপুটে সঠিক কাজ করে কি না। রেড টিমিং, কোথায় এটি ভুল আচরণ করে খুঁজতে সুচিন্তিতভাবে নিজের সিস্টেম আক্রমণ করা, চাপের মধ্যে কী ঘটে তা মাপে। প্রম্পট ইনজেকশন, জেলব্রেক, অনিরাপদ কনটেন্ট, গোপনীয়তা ফাঁস এবং পক্ষপাতী আউটপুট খোঁজ করুন। এটিকে একবারের অনুশীলন নয়, একটি পুনরাবৃত্তিযোগ্য স্যুট করুন: প্রতিটি সফল আক্রমণ একটি স্থায়ী রিগ্রেশন কেসে পরিণত করুন যাতে একটি সারা দুর্বলতা সারা থাকে। এই কাজ সরাসরি দায়িত্বশীল ও বিশ্বস্ত AI (অধ্যায় 6.5)-এর সঙ্গে যুক্ত, এবং নিয়ন্ত্রিত পরিবেশে এটি প্রায়ই একটি নিরাপত্তা পর্যালোচনা সন্তুষ্ট করা প্রমাণ।

শুরু-থেকে-শেষ কাজ সাফল্যে এজেন্ট মূল্যায়ন করুন

যে এজেন্ট অনেক ধাপে পরিকল্পনা ও কাজ করে তাদের একবারে একটি আউটপুট বিচার করা যায় না। যা গুরুত্বপূর্ণ তা হলো পুরো কাজ সফল হয়েছে কি না: এজেন্ট কি মিটিং বুক করেছে, টিকিট সমাধান করেছে বা কর্মপ্রবাহ সঠিকভাবে ও নিরাপদে সম্পূর্ণ করেছে। একটি স্যান্ডবক্সড পরিবেশে কাজ-স্তরের মূল্যায়ন গড়ুন যেখানে এজেন্ট প্রকৃত কিন্তু নিরাপদ ফিক্সচারের বিপরীতে কাজ করতে পারে, এবং চূড়ান্ত ফল সঙ্গে ট্র্যাজেক্টরি, অর্থাৎ সেখানে পৌঁছাতে নেওয়া ধাপ ও টুল কলের ক্রম, স্কোর করুন। একটি বিপজ্জনক বা অপচয়ী পথে পৌঁছানো একটি সঠিক উত্তর তবুও একটি সমস্যা। এটি AI এজেন্ট ও এজেন্টিক সিস্টেম (অধ্যায় 6.7)-এর জন্য অপরিহার্য, যেখানে একটি একক ভুল কাজ প্রকৃত পরিণতি ডাকতে পারে।

CI-তে মূল্যায়ন জুড়ুন এবং প্রোডাকশন পর্যবেক্ষণ করুন

মূল্যায়ন স্বয়ংক্রিয় করুন। প্রতিটি প্রম্পট, মডেল বা পুনরুদ্ধার পরিবর্তনে নিরন্তর ইন্টিগ্রেশন (CI)-তে আপনার অফলাইন স্যুট চালান, এবং আপনি ইউনিট টেস্টে যেভাবে গেট করেন সেভাবে এতে মার্জ গেট করুন, আপনার বৃহত্তর টেস্টিং কৌশল (অধ্যায় 2.4)-এ মূলযুক্ত একটি চর্চা। কারণ স্কোর গোলমাল, নিখুঁত রান দাবি করার বদলে সীমা ও প্রবণতায় গেট করুন, এবং একটি মূল মেট্রিক তার মেঝের নিচে নামলে বা নির্ধারিত মার্জিন ছাড়িয়ে রিগ্রেস করলে বিল্ড ব্যর্থ করুন। তারপর প্রোডাকশনে নজর রাখুন: অফলাইন পরীক্ষা মিস করা ধীর অবনতি ধরতে মান সংকেত, আউটপুট বিতরণ এবং ইনপুট ড্রিফট পর্যবেক্ষণ করুন, যা মেশিন লার্নিং প্রকৌশল ও MLOps (অধ্যায় 6.2)-এর পর্যবেক্ষণযোগ্যতা চর্চার সঙ্গে যুক্ত। লঞ্চে নির্ভুল একটি মডেল তার বর্ণিত জগৎ নিচে বদলালে ক্ষয় হতে পারে।

ট্রেড-অফ: সুবিধা ও অসুবিধা

মূল্যায়ন পদ্ধতিসুবিধাঅসুবিধাসবচেয়ে ভালো যখন
মানব মূল্যায়নসর্বোচ্চ বিশ্বস্ততা, সূক্ষ্মতা ধরেধীর, ব্যয়বহুল, স্কেল করা কঠিনমূল সত্য, উচ্চ-ঝুঁকি, বিচারক ক্যালিব্রেট করা
LLM-অ্যাজ-এ-জাজদ্রুত, সস্তা, বড় সেটে স্কেল করেপক্ষপাতী, ক্যালিব্রেশন লাগেজেনারেটিভ আউটপুটে ঘন ঘন অফলাইন রান
রেফারেন্স-ভিত্তিক মেট্রিক (BLEU, ROUGE)সস্তা, নির্ধারণবাদী, পুনরাবৃত্তিযোগ্যপ্রকৃত মানের দুর্বল প্রক্সিস্থূল রিগ্রেশন সংকেত, চূড়ান্ত রায় নয়
ক্লাসিক মেট্রিক (প্রিসিশন, রিকল, F-স্কোর)নৈর্ব্যক্তিক, ভালো বোঝাকেবল সঠিক লেবেলযুক্ত কাজে মানায়শ্রেণিবিন্যাস, নিষ্কাশন, পুনরুদ্ধার
পাবলিক বেঞ্চমার্কমডেল জুড়ে তুলনাযোগ্য, সেটআপ নেইদূষণ, আপনার কাজে দুর্বল মানানসইপ্রাথমিক মডেল শর্টলিস্টিং, রিলিজ গেট নয়
অনলাইন মূল্যায়ন (A/B, প্রতিক্রিয়া)প্রকৃত ব্যবহারকারী ও ফল প্রতিফলিত করেধীর, উন্মুক্ততার পরে আসেএকটি পরিবর্তন আসলে সাহায্য করেছে নিশ্চিত করা

কেন্দ্রীয় টানাপোড়েন গতি বনাম বিশ্বস্ততা। মানব মূল্যায়ন সবচেয়ে বিশ্বস্ত এবং সবচেয়ে কম স্কেলযোগ্য; স্বয়ংক্রিয় গ্রেডিং উল্টো। সমাধান হলো স্তরে স্তরে রাখা: ধ্রুব পুনরাবৃত্তির জন্য দ্রুত, সস্তা পদ্ধতি ব্যবহার করুন, নিয়মিত ক্যালিব্রেশনের মাধ্যমে সেই পদ্ধতি মানব বিচারে নোঙর করুন, এবং পূর্ণ মানব পর্যালোচনা সবচেয়ে উচ্চ-ঝুঁকির সিদ্ধান্ত এবং আপনার সস্তা মেট্রিক এখনো বাস্তবতা অনুসরণ করে কি না পরীক্ষার জন্য সংরক্ষণ করুন। দ্বিতীয় টানাপোড়েন অফলাইন সুবিধা বনাম অনলাইন সত্য। অফলাইন সেট আপনাকে দ্রুত চলতে দেয় কিন্তু প্রোডাকশন কখনো পুরোপুরি প্রতিফলিত করে না, তাই একটি শক্তিশালী অফলাইন স্কোরকে আপনি শেষ করেছেন তার প্রমাণ নয়, একটি সতর্ক অনলাইন টেস্ট চালানোর অনুমতি গণ্য করুন।

আপনার দলের সঙ্গে আলোচনার প্রশ্ন

  1. আমাদের “যথেষ্ট ভালো”-র মান কী, এবং তা সংজ্ঞায়িত করা eval সেটের মালিক কে? প্রতিটি AI ফিচারের একটি অন্তর্নিহিত মান সীমা আছে, এবং তা অন্তর্নিহিত থাকলে প্রতিটি ইঞ্জিনিয়ার অনুভূতিতে নিজেরটি ঠিক করে এবং বিরোধ ঘরে সবচেয়ে বরিষ্ঠ যে তার দ্বারা নিষ্পত্তি হয়। মানকে প্রতি-বিভাগ লক্ষ্য স্কোরসহ একটি চালানোযোগ্য eval সেট হিসেবে লেখা সেই বিরোধ পরিমাপযোগ্য প্রশ্নে পরিণত করে। সাফল্যের আপনার বর্তমান সংজ্ঞা, তার পেছনের ডেটা, এবং আসলে কে তা রক্ষণাবেক্ষণ করে তার একটি সৎ বিবরণ আনুন, কারণ মালিকহীন একটি eval সেট অন্য যেকোনো অযত্ন কোডের মতোই দ্রুত পচে। ঠিক করুন মান ঝুঁকি স্তর অনুযায়ী ভিন্ন কি না, কারণ জনমুখী আইনি উত্তরকে একটি অভ্যন্তরীণ বুদ্ধিমন্থন সহায়কের চেয়ে উচ্চতর মান পেরোতে হবে। উত্তর আপনাকে বলা উচিত কেউ বর্তমানে ব্যবহারকারীদের এবং নিজের মধ্যে কোনো পরিমাপ ছাড়া একটি AI পরিবর্তন পাঠাতে পারে কি না।

  2. আমাদের মূল্যায়ন সংখ্যা দূষিত বা ওভারফিটেডের বদলে সৎ আমরা কীভাবে জানি? একটি স্কোর কেবল উপযোগী যদি তা প্রকৃত-জগৎ মান ভবিষ্যদ্বাণী করে, এবং এটি তা বন্ধ করার অনেক উপায় আছে: প্রশিক্ষণে ফাঁস হওয়া বেঞ্চমার্ক ডেটা, সংখ্যা অর্থহীন না হওয়া পর্যন্ত টেস্ট সেটের বিপরীতে প্রম্পট টিউন করা ডেভেলপার, বা কখনো যাচাই না করা উত্তরে গড়া একটি গোল্ডেন ডেটাসেট। আপনার eval ডেটা কোথা থেকে এসেছে, তার কতটা ব্যক্তিগত রাখা, এবং কত ঘন ঘন সতেজ করা হয় তার প্রমাণ আনুন। আলোচনা করুন আপনি কখনো-সখনো দেখেন এমন একটি নতুন হোল্ডআউট রাখেন কি না, যাতে অন্তত একটি সংখ্যা থাকে যার বিপরীতে কেউ অপ্টিমাইজ করছে না। আপনার স্কোর মডেল কখনো প্রভাবিত করেনি এমন ডেটায় কেন টিকবে ব্যাখ্যা করতে না পারলে আপনি আপনার নিজের প্রতিচ্ছবি মাপছেন।

  3. মানুষ কোথায় চক্রে থাকে, এবং আমরা আমাদের স্বয়ংক্রিয় বিচারক তাদের সঙ্গে ক্যালিব্রেট কীভাবে রাখি? LLM-অ্যাজ-এ-জাজ ও রেফারেন্স মেট্রিক আপনাকে পরিসরে গ্রেড করতে দেয়, এবং আপনি পরীক্ষা না করলে অদৃশ্য উপায়ে মানব বিচার থেকে সরে। স্বয়ংক্রিয় গ্রেডিং ও মানব পর্যালোচনার মধ্যে আপনার বর্তমান একমত হার, শেষ কবে আপনি তা মেপেছেন, এবং কোন পক্ষপাত (দৈর্ঘ্য, অবস্থান, ধরন) আপনি পরীক্ষা করেছেন আনুন। ঠিক করুন কোন সিদ্ধান্ত খরচ নির্বিশেষে একজন মানব গ্রেডার দাবি করে, সাধারণত সবচেয়ে উচ্চ-ঝুঁকির এবং স্বয়ংক্রিয় বিচারক পুনঃক্যালিব্রেট করতে ব্যবহৃত। টীকার মান নিয়েও কথা বলুন, কারণ অসঙ্গত মানব লেবেলের বিপরীতে ক্যালিব্রেট করা বিচারক সেই অসঙ্গতি উত্তরাধিকার পায়। উত্তর একটি এককালীন আশীর্বাদ নয়, পুনঃক্যালিব্রেশনের একটি সূচি তৈরি করা উচিত।

  4. আজ কোন AI পরিবর্তন মূল্যায়নে গেট করা, এবং কোনগুলো এখনো কারও আত্মবিশ্বাসেই ব্যবহারকারীদের কাছে পৌঁছায়? কিছু পরিবর্তনে চলা কিন্তু অন্যদের নয় এমন একটি গেট আপনাকে নিরাপত্তার ভ্রম দেয় যখন প্রকৃত রিগ্রেশন গেটহীন পথে পিছলে যায়: একটি নীরব প্রম্পট টুইক, একটি পুনরুদ্ধার টিউনিং, একটি মডেল সংস্করণ বাম্প যা কেউ পরিবর্তন গণ্য করেনি। একটি বড় দলের জন্য বিপদ একটি প্রম্পট ছুঁতে পারা মানুষের সংখ্যার সঙ্গে বাড়ে, কারণ প্রতিটি গেটহীন পথ এমন একটি রিগ্রেশন পাঠানোর উপায় যা কোনো ডেটাসেট কখনো দেখেনি। নিরন্তর ইন্টিগ্রেশনে বর্তমানে অফলাইন স্যুট ট্রিগার করা পরিবর্তন ধরনের তালিকা, যেগুলো করে না, এবং একটি গেটহীন পরিবর্তনে ট্রেস করা শেষ কয়েকটি ঘটনা আনুন। গেট কোন সীমা ও প্রবণতা প্রয়োগ করে ঠিক করুন, কারণ একটি গোলমাল স্কোর নিখুঁত রান দাবির বদলে একটি মেঝে ও রিগ্রেশন মার্জিন দাবি করে। এন্টারপ্রাইজ ও সরকারি পরিবেশে গেটকে রিলিজ রেকর্ডের সঙ্গেই বাঁধুন, যাতে একটি পরিবর্তন মাপা হয়েছিল তার প্রমাণ নিরীক্ষা ট্রেইলের অংশ, কেউ একবার তোলা স্ক্রিনশট নয়।

  5. আমরা মূল্যায়নে কত ব্যয় করছি, এবং সেই ব্যয় কি প্রতিটি ফিচারের ঝুঁকির সঙ্গে মেলানো? মূল্যায়ন বিনামূল্যের নয়: টীকা শ্রম, স্বয়ংক্রিয় বিচারক প্রতিটি রানে যে কম্পিউট পোড়ায়, এবং গোল্ডেন ডেটাসেট প্রতিনিধিত্বমূলক রাখার স্থায়ী কাজ সবই প্রকৃত অর্থ খরচ করে, এবং যে দল কখনো এই খরচের নাম দেয় না সে হয় একটি উচ্চ-ঝুঁকির ফিচারে কম-বিনিয়োগ করে নয়তো একটি ফেলনায় সোনার প্রলেপ দেয়। প্রতিদ্বন্দ্বী টান বিশ্বস্ততা ও বাজেটের মধ্যে, কারণ সবচেয়ে বিশ্বস্ত পদ্ধতি, বিশেষজ্ঞ মানব পর্যালোচনা, সবচেয়ে কম স্কেলযোগ্যও, তাই আপনি সর্বত্র তা ব্যয় করতে পারেন না এবং ঠিক করতে হবে কোথায় এটি তার দাম অর্জন করে। বর্তমান প্রতি মূল্যায়ন রানের খরচ, প্রতি ফিচারে টীকা ঘণ্টা, এবং প্রতিটি সিস্টেমের জন্য একটি সৎ ঝুঁকি স্তর আনুন যাতে ঘর দেখতে পারে অর্থ কোথায় যায় বনাম বিপদ কোথায় বাস করে। একটি এন্টারপ্রাইজের জন্য এটি অনেক দল জুড়ে টীকা ও কম্পিউট amortise করা একটি ভাগ করা মূল্যায়ন প্ল্যাটফর্মের সবচেয়ে শক্তিশালী যুক্তি; একটি সরকারি সংস্থার জন্য ঝুঁকি স্তর সরাসরি একটি তত্ত্বাবধান সংস্থা পরে দাবি করবে এমন প্রমাণের গভীরতায় ম্যাপ করা উচিত।

  6. একটি ভালো মডেল এলে, তা সাহায্য করে কি না প্রমাণ করতে আমরা কত দ্রুত পারি, এবং বদলানোর অনুমতি কার? একটি মূল্যায়ন স্যুটের মূল্য সবচেয়ে তীব্রভাবে উপলব্ধ হয় যেদিন একটি শক্তিশালী মডেল পাঠানো হয়, কারণ যে দল একটি বিকেলে নতুন মডেলের বিপরীতে তার গোল্ডেন ডেটাসেট ও রেড-টিম স্যুট চালাতে পারে সে এমন উন্নতি গ্রহণ করতে পারে যা হাতে গ্রেড করা দল মাস ধরে মিস করবে। টানাপোড়েন গতি ও সতর্কতার মধ্যে: আপনি একটি ভালো মডেল দেখা দেওয়ার দিনই সরতে চান, এবং আপনার গড় স্কোর লুকায় এমন উত্তরের একটি শ্রেণি একটি অদলবদল নীরবে অবনত করতে দিতে পারেন না। একটি নতুন প্রদানকারীর বিপরীতে একটি পূর্ণ অফলাইন তুলনা চালাতে বর্তমানে কত সময় লাগে, আপনার eval সেট মডেল জুড়ে বহনযোগ্য কি না, এবং কোন বিভাগে একটি রিগ্রেশন সবচেয়ে গুরুত্বপূর্ণ হবে আনুন। নিয়ন্ত্রিত ও সরকারি পরিবেশে নাম দিন একটি মডেল পরিবর্তন অনুমোদনের কর্তৃত্ব কার এবং কোন নথিবদ্ধ প্রমাণ তাঁরা দাবি করেন, কারণ একটি নাগরিক-মুখী সিদ্ধান্তের পেছনের মডেলের অনথিবদ্ধ অদলবদল ঠিক সেই ধরনের পরিবর্তন যা একজন নিরীক্ষক আপনাকে যথার্থ করতে বলবেন।

খাতভেদে দৃষ্টিভঙ্গি

স্টার্টআপ। আপনি পারেন সবচেয়ে ছোট সৎ eval গড়ুন এবং পণ্যের সঙ্গে বাড়তে দিন। প্রতিটি কেসের যাচাইকৃত প্রত্যাশিত উত্তরসহ বিশ থেকে চল্লিশটি প্রকৃত কেসের একটি স্প্রেডশিট, প্রতিটি মার্জের আগে একটি স্ক্রিপ্ট দিয়ে চালানো, আপনার কুলুঙ্গির জন্য যেকোনো পাবলিক বেঞ্চমার্ককে হারায় এবং প্রায় কিছুই খরচ করে না। হাতে গ্রেডিং আসলে ব্যথা না দেওয়া পর্যন্ত ভাগ করা প্ল্যাটফর্ম ও LLM-অ্যাজ-এ-জাজ এড়ান, কিন্তু প্রথম দিন থেকে প্রতিটি ব্যবহারকারী-প্রতিবেদিত ব্যর্থতা সেটে ভাঁজ করুন, কারণ সেই প্রতিক্রিয়াই একই বিব্রত অবস্থা দুবার ঘটা ঠেকায়।

ছোট ব্যবসা। আপনার সম্ভবত কোনো মূল্যায়ন বিশেষজ্ঞ নেই এবং আপনার AI টুলে এমবেড করা কেনেন, তাই আপনার কাজ প্রমাণ দাবি করা, গড়া নয়। প্রতিটি বিক্রেতাকে জিজ্ঞেস করুন তারা মান কীভাবে মেপেছে, তারা আপনার ডেটার মতো ডেটায় পরীক্ষা করে কি না, এবং আপনি বাছেননি এমন একটি হালনাগাদের পরে রিগ্রেশন আপনি কীভাবে লক্ষ করবেন। টুল নিজে স্পট-চেক করতে আপনার নিজস্ব প্রকৃত কেসের একটি ছোট ব্যক্তিগত সেট রাখুন, কারণ একজন গ্রাহকের কাছে পৌঁছানো একটি ভুল স্বয়ংক্রিয় উত্তর সেই পরীক্ষার মিনিটের চেয়ে আপনাকে অনেক বেশি খরচ করে।

এন্টারপ্রাইজ। পুরস্কার হলো একটি ভাগ করা মূল্যায়ন প্ল্যাটফর্ম যাতে ডজনখানেক দল প্রত্যেকে গ্রেডিং পুনরাবিষ্কার না করে: গোল্ডেন ডেটাসেটের জন্য একটি সাধারণ স্টোর, নিরন্তর ইন্টিগ্রেশনে গেট করা অফলাইন স্যুট, ক্যালিব্রেশন স্কোরসহ নিবন্ধিত LLM-জাজ প্রম্পট, এবং প্রতি ফিচারে অনলাইন মেট্রিক। এর ওপরে শাসন স্তর দিন যেখানে ঝুঁকি স্তর প্রয়োজনীয় মান ও রিলিজের আগে অনুমোদন ঠিক করে, যাতে একটি উচ্চ-ঝুঁকির ফিচার একটি অভ্যন্তরীণ সহায়কের চেয়ে উচ্চতর গেট পেরোয়। প্ল্যাটফর্ম দল জুড়ে টীকা ও কম্পিউট amortise করে, যা প্রতিটি গোষ্ঠীকে অ্যাড হক করতে দেওয়ার বদলে একটি গড়ার সবচেয়ে শক্তিশালী কারণ।

সরকার। মূল্যায়ন কেবল করা নয়, নিরীক্ষণযোগ্য হতে হবে, তাই প্রতিটি রিলিজের জন্য ডেটাসেট সংস্করণ, মেট্রিক, পর্যালোচকের নাম এবং অনুমোদন জবাবদিহি প্রমাণ হিসেবে সংরক্ষণ করুন। একটি রেড-টিম স্যুট প্রমাণ করা উচিত সিস্টেম তার উৎসে অনুপস্থিত নীতি বা আইন উদ্ভাবন করতে প্রত্যাখ্যান করে, এবং ক্রয়ে বিক্রেতাদের মডেল কীভাবে মূল্যায়ন করেছে প্রকাশ করতে এবং আপনার eval ডেটার বহনযোগ্যতা দিতে দাবি করা উচিত। একটি তত্ত্বাবধান সংস্থা জিজ্ঞেস করলে আপনি কীভাবে জানেন টুল নিরাপদ, উত্তর অবশ্যই একটি তারিখযুক্ত রেকর্ড, একটি আশ্বাস নয়।

উদাহরণ

স্টার্টআপ। একটি AI চুক্তি-পর্যালোচনা সহকারী গড়া চারজনের একটি কোম্পানি চল্লিশটি প্রকৃত ধারার একটি স্প্রেডশিট দিয়ে শুরু করে, প্রতিটি তাদের অভ্যন্তরীণ আইনজীবী কোন ঝুঁকি চিহ্নিত করা উচিত তা দিয়ে লেবেল করেছেন। প্রতিটি প্রম্পট পরিবর্তন মার্জের আগে একটি স্ক্রিপ্টে সেই সেটের বিপরীতে চলত, এবং স্কোর পুল রিকোয়েস্টে ছাপা হতো। একজন ব্যবহারকারী একটি মিস করা ধারা চিহ্নিত করলে তা সরাসরি শিটে যেত, তাই সেট পণ্যের সঙ্গে বাড়ত। পরিমাণ বাড়লে তারা ব্যাখ্যা মান গ্রেড করতে একটি LLM-অ্যাজ-এ-জাজ যোগ করে, কিন্তু কেবল একটি নমুনায় আইনজীবীর সঙ্গে একমত কি না পরীক্ষা করার পরে। সস্তা, ব্যক্তিগত ও সৎ তাদের কুলুঙ্গির জন্য যেকোনো পাবলিক বেঞ্চমার্ককে হারায়।

এন্টারপ্রাইজ। একটি বড় ব্যাংক সহায়তা, অনুসন্ধান ও অভ্যন্তরীণ টুলিং জুড়ে ডজনখানেক AI ফিচার চালাত, এবং প্রতিটি দল ভিন্নভাবে গ্রেড করত। তারা একটি ভাগ করা মূল্যায়ন প্ল্যাটফর্ম গড়ে: গোল্ডেন ডেটাসেট সংরক্ষণ, CI-তে অফলাইন স্যুট চালানো, ক্যালিব্রেশন স্কোরসহ LLM-জাজ প্রম্পট নিবন্ধন, এবং প্রতি ফিচারে অনলাইন মেট্রিক অনুসরণের একটি সাধারণ জায়গা। শাসন ওপরে বসে, ঝুঁকি স্তর প্রয়োজনীয় মান ও রিলিজের আগে প্রয়োজনীয় অনুমোদন ঠিক করে। একটি নতুন প্রতারণা-ব্যাখ্যা ফিচার তার eval সেট পর্যালোচিত, তার রেড-টিম স্যুট পাস এবং তার জবাবদিহিযোগ্য মালিক ফল সই না করা পর্যন্ত পাঠানো যেত না। প্ল্যাটফর্ম পুনর্ব্যবহার মানে দলগুলো কীভাবে মাপতে হয় নিয়ে নয়, তাদের ডোমেইন নিয়ে তর্ক করত।

সরকার। একটি সরকারি স্বাস্থ্য সংস্থা অনুমোদিত নির্দেশনা থেকে সুবিধা প্রশ্নের উত্তর দিতে কর্মীদের সাহায্য করতে একটি সহকারী ডিপ্লয় করে। কারণ একটি ভুল উত্তর কারও যোগ্যতা প্রভাবিত করতে পারত, মূল্যায়ন নিরীক্ষণযোগ্য হতে হতো। প্রতিটি রিলিজ সাধারণ প্রশ্ন, প্রান্তিক কেস ও বিরোধী প্রম্পট ঢাকা একটি নথিবদ্ধ eval সেট চালাত, এবং ফল, ডেটাসেট সংস্করণ, মেট্রিক ও পর্যালোচকের নাম জবাবদিহি প্রমাণ হিসেবে সংরক্ষিত হতো। একটি রেড-টিম স্যুট পরীক্ষা করত সিস্টেম তার উৎসে অনুপস্থিত নীতি বা আইন উদ্ভাবন করতে প্রত্যাখ্যান করে। একটি তত্ত্বাবধান সংস্থা জিজ্ঞেস করলে সংস্থা কীভাবে জানে টুল নিরাপদ, উত্তর ছিল একটি তারিখযুক্ত রেকর্ড, একটি আশ্বাস নয়।

ব্যবসায়িক যুক্তি: প্রেরণা, ROI ও TCO

মূল্যায়ন অন্য প্রতিটি AI বিনিয়োগ নিরাপদ ও দ্রুততর করে নিজের খরচ তোলে। এর বিনিয়োগের প্রতিদান (ROI) দেখা দেয় কম প্রোডাকশন ঘটনা, দ্রুততর পুনরাবৃত্তি কারণ দলগুলো আত্মবিশ্বাসে প্রম্পট ও মডেল বদলাতে পারে, এবং ভালো মডেল আসার দিনই গ্রহণ করার সামর্থ্য কারণ আপনি প্রমাণ করতে পারেন তা সাহায্য করে কি না। এর মূল্য ঠিক করার স্পষ্টতম উপায় এর অনুপস্থিতির খরচ: একটি একক জনসম্মুখ হ্যালুসিনেশন, পক্ষপাতী আউটপুট বা ডেটা ফাঁস বছরের মূল্যায়ন অবকাঠামোর চেয়ে প্রতিকার, হারানো আস্থা ও নিয়ন্ত্রক উন্মুক্ততায় অনেক বেশি খরচ করতে পারে। এটি CI-তে বিনামূল্যে একটি রিগ্রেশন খুঁজে পাওয়া এবং সংবাদপত্রে তা খুঁজে পাওয়ার পার্থক্য।

মালিকানার মোট খরচ (TCO) প্রকৃত এবং নাম দেওয়ার যোগ্য। আপনি টীকা শ্রম, স্বয়ংক্রিয় বিচারক যে কম্পিউট খরচ করে, এবং ব্যবহার সরলে eval সেট প্রতিনিধিত্বমূলক রাখার চলমান কাজের জন্য অর্থ দেন। এন্টারপ্রাইজ পরিসরে একটি ভাগ করা প্ল্যাটফর্ম এর বেশিরভাগ অনেক দল জুড়ে amortise করে, যা প্রতিটি গোষ্ঠীকে অ্যাড হক করতে দেওয়ার বদলে একটি গড়ার সবচেয়ে শক্তিশালী যুক্তি। আপনার ক্ষেত্রে একটি খারাপ জনসম্মুখ উত্তরের খরচের একটি সুনির্দিষ্ট ঝুঁকিকে প্রতিটি নতুন মডেল নিরাপদে গ্রহণের গতির একটি সুনির্দিষ্ট সামর্থ্যের সঙ্গে জোড়া দিয়ে, এবং মূল্যায়নকে সেই নিয়ন্ত্রণ হিসেবে ফ্রেম করে যা প্রতিষ্ঠানকে বেপরোয়া না হয়ে দ্রুত চলতে দেয়, নেতৃত্বের কাছে যুক্তি দিন।

অ্যান্টি-প্যাটার্ন ও ফাঁদ

  • অনুভূতি-ভিত্তিক পাঠানো। কোনো ডেটাসেট ও পুনরাবৃত্তিযোগ্য স্কোর ছাড়া হাতে কয়েকটি প্রম্পট চেষ্টা করে AI পরিবর্তন বিচার।
  • বেঞ্চমার্ক নাট্য। দূষণ ও বিতরণ অমিল উপেক্ষা করে একটি শক্তিশালী পাবলিক বেঞ্চমার্ক স্কোরকে সিস্টেম আপনার কাজে মানানোর প্রমাণ বিশ্বাস।
  • eval সেটে ওভারফিটিং। একটি নতুন হোল্ডআউট ছাড়া সংখ্যা উচ্চ ও অর্থহীন না হওয়া পর্যন্ত একই নির্দিষ্ট সেটের বিপরীতে প্রম্পট টিউন।
  • অক্যালিব্রেট করা বিচারক। একটি LLM-অ্যাজ-এ-জাজ ডিপ্লয় এবং মানব গ্রেডারদের সঙ্গে একমত কখনো পরীক্ষা না করে তার স্কোরে বিশ্বাস।
  • মেট্রিক পূজা। BLEU বা ROUGE-কে মান হিসেবে অপ্টিমাইজ এবং রেফারেন্স পাঠ্যের সঙ্গে ওভারল্যাপ করা খারাপ উত্তর পাঠানো।
  • একবারের রেড টিমিং। লঞ্চের আগে একবার সিস্টেম আক্রমণ এবং পর্যবেক্ষণ স্থায়ী রিগ্রেশন টেস্টে কখনো পরিণত না করা।
  • কেবল-অফলাইন আত্মবিশ্বাস। প্রকৃত ফলের কোনো অনলাইন মাপ ছাড়া একটি ভালো অফলাইন স্কোর মানে ফিচার কাজ করে বিশ্বাস।
  • এতিম eval সেট। কেউ মালিক নয় এমন ডেটাসেট, যা প্রোডাকশন ব্যর্থতা কখনো আত্মস্থ করে না এবং ধীরে বাস্তবতা প্রতিফলিত করা বন্ধ করে।

পরিপক্বতা মডেল

  • স্তর ১, সূচনা: AI পরিবর্তন হাতে কয়েকটি উদাহরণে, প্রতিক্রিয়াশীলভাবে বিচার করা হয় যখন কেউ উদ্বিগ্ন হয়। কোনো ডেটাসেট, পুনরাবৃত্তিযোগ্য স্কোর বা গেট নেই। রিগ্রেশন ব্যবহারকারীরা খুঁজে পায়, এবং কেউ বলতে পারে না সিস্টেম গত মাসের চেয়ে ভালো বা খারাপ।
  • স্তর ২, বিকাশ: কিছু দল ছোট গোল্ডেন ডেটাসেট রাখে এবং বড় পরিবর্তনের আগে ম্যানুয়ালি চালায়, এবং কয়েকটি ক্লাসিক বা রেফারেন্স-ভিত্তিক স্কোর আছে। গুরুত্বপূর্ণ ফিচারের জন্য মানব পর্যালোচনা ঘটে, কিন্তু গ্রেডিং দল জুড়ে অসঙ্গত, মূল্যায়ন স্বয়ংক্রিয় বা গেট করা নয়, এবং প্রতিটি গোষ্ঠী ভিন্নভাবে করে।
  • স্তর ৩, মানসম্মতকরণ: অফলাইন স্যুট প্রতিটি প্রম্পট, মডেল বা পুনরুদ্ধার পরিবর্তনে নিরন্তর ইন্টিগ্রেশনে চলে এবং মার্জ গেট করে, প্রতিষ্ঠান জুড়ে একটি নথিবদ্ধ চর্চা অনুসরণ করে। LLM-অ্যাজ-এ-জাজ মানব লেবেলের বিপরীতে ক্যালিব্রেট করা, রেড টিমিং একটি পুনরাবৃত্তিযোগ্য স্যুট, এবং ডেটাসেট মালিকানাধীন, সংস্করণ করা এবং প্রোডাকশন ব্যর্থতা দিয়ে জোগান পায়, দূষণের বিরুদ্ধে সক্রিয়ভাবে রক্ষা করে।
  • স্তর ৪, ব্যবস্থাপনা: মূল্যায়ন ভিত্তিরেখার বিপরীতে তথ্য দিয়ে মাপা ও নিয়ন্ত্রিত। বিচারক-থেকে-মানব একমত হার, রেড-টিম পাস হার, প্রতি-বিভাগ স্কোর, অনলাইন কাজ সাফল্য এবং ড্রিফট সময়ের সঙ্গে অনুসরণ করা, এবং মার্জ একটি নিখুঁত রানের বদলে সীমা ও রিগ্রেশন মার্জিনে গেট করে। টীকা খরচ ও প্রতি রানে কম্পিউট প্রতি ফিচারে বাজেট করা, পুনঃক্যালিব্রেশন একটি সূচিতে ঘটে, এবং প্রতিটি ফল একজন জবাবদিহিযোগ্য মালিক ও অনুমোদন বহন করে।
  • স্তর ৫, সমন্বয়: একটি ভাগ করা মূল্যায়ন প্ল্যাটফর্ম পুরো প্রতিষ্ঠানকে সেবা দেয়, এবং অফলাইন ও অনলাইন মূল্যায়ন ব্যবসায়িক ফলাফলের সঙ্গে বাঁধা একটি নিরন্তর চক্র গঠন করে। নতুন মডেল আসার দিনই বহনযোগ্য eval সেটের বিপরীতে প্রমাণিত হয়, ব্যবহার ও ঝুঁকি সরলে পোর্টফোলিও খাপ খায়, মূল্যায়ন প্রমাণ নিয়ন্ত্রক ও তত্ত্বাবধানের জন্য নিরীক্ষণযোগ্য, এবং এক দলের ব্যর্থতার শিক্ষা প্রতিটি দলের ডেটাসেটে প্রবাহিত হয়।

আলোচনার ভাবনা

  1. একটি অফলাইন স্কোর একটি অনলাইন পরীক্ষা যথার্থ করতে কখন যথেষ্ট শক্তিশালী, এবং কখন নয় আপনি কীভাবে ঠিক করেন?
  2. আপনার ঝুঁকি প্রোফাইলের জন্য মানব মূল্যায়ন ও স্বয়ংক্রিয় গ্রেডিংয়ের সঠিক অনুপাত কী, এবং কত ঘন ঘন আপনার তা পুনর্বিবেচনা করা উচিত?
  3. একটি পাবলিক বেঞ্চমার্ক এবং আপনার ব্যক্তিগত eval সেট কোন মডেল ভালো তা নিয়ে অসম্মত হলে আপনি কোনটি বিশ্বাস করেন এবং কেন?
  4. CI-তে চালানোর জন্য খুব ধীর কিছুতে ফুলে না গিয়ে ব্যবহারকারী আচরণ সরলে আপনি eval সেট প্রতিনিধিত্বমূলক কীভাবে রাখেন?
  5. আপনার ক্ষেত্রের জন্য একটি রেড-টিম স্যুটে কী থাকা উচিত, এবং আক্রমণ নকশা করতে কে যোগ্য?
  6. প্রতিটি ধাপ গ্রেড করার খরচে না ডুবে আপনি একটি এজেন্টের কেবল চূড়ান্ত উত্তর নয়, ট্র্যাজেক্টরি কীভাবে মূল্যায়ন করেন?

প্রধান শিক্ষা

  • AI মূল্যায়ন সফটওয়্যার টেস্টিং থেকে ভিন্ন কারণ আউটপুট অ-নির্ধারণবাদী এবং কদাচিৎ একটি সঠিক উত্তর আছে, তাই আপনি সঠিক মান দাবির বদলে প্রতিনিধিত্বমূলক কেস জুড়ে মান মাপেন।
  • eval-চালিত উন্নয়ন চর্চা করুন: আগে পরিমাপযোগ্য মান সংজ্ঞায়িত করুন, তারপর সেদিকে গড়ুন, এবং প্রতিটি প্রোডাকশন ব্যর্থতা সেটে ফিরিয়ে ভাঁজ করুন।
  • গতি ও বিশ্বস্ততা অনুযায়ী পদ্ধতি স্তরে রাখুন: ধ্রুব পুনরাবৃত্তির জন্য সস্তা স্বয়ংক্রিয় গ্রেডিং, নোঙর হিসেবে মানব বিচার, এবং তাদের সারিবদ্ধ রাখতে ক্যালিব্রেশন।
  • দূষণ ও ওভারফিটিংয়ের বিরুদ্ধে রক্ষা করুন, নইলে প্রকৃত সিস্টেম ব্যবহারকারীদের হতাশ করার সময় আপনার সংখ্যা আপনাকে তোষামোদ করবে।
  • অফলাইন মূল্যায়ন CI-তে গেট হিসেবে জুড়ুন এবং প্রোডাকশনে মান ও ড্রিফট মাপতে থাকুন, কারণ লঞ্চে ভালো একটি মডেল ক্ষয় হতে পারে।

তথ্যসূত্র ও আরও পড়ার জন্য

  • Chip Huyen, AI Engineering: Building Applications with Foundation Models.
  • Lianmin Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.
  • Kishore Papineni et al., BLEU: A Method for Automatic Evaluation of Machine Translation.
  • Chin-Yew Lin, ROUGE: A Package for Automatic Evaluation of Summaries.
  • Percy Liang et al., Holistic Evaluation of Language Models (HELM).
  • Deep Ganguli et al., Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviours, and Lessons Learned.
  • OWASP Foundation, OWASP Top 10 for Large Language Model Applications.
  • National Institute of Standards and Technology, AI Risk Management Framework.