পরবর্তী গুরুত্বপূর্ণ AI স্থাপন হয়তো কোনো বিশাল ক্লাউড ক্লাস্টারে চলবে না। এটি চলতে পারে একটি ক্যামেরা, কারখানার রোবট, যানবাহন, চিকিৎসা-যন্ত্র বা খুচরা বিক্রয় টার্মিনালের ভেতরে—যেখানে সম্ভাব্য বৃহত্তম মডেল থাকার চেয়ে ব্যান্ডউইথ, বিদ্যুৎ, লেটেন্সি, গোপনীয়তা এবং পরিচালন ব্যয় বেশি গুরুত্বপূর্ণ।
এই পরিবর্তন AI কাজের একটি ভিন্ন ধরনের ক্ষেত্র তৈরি করছে। দলগুলোর এখনও মডেল নির্মাতা দরকার, তবে তাদের এমন লোকও দরকার যারা মডেলকে বাস্তব হার্ডওয়্যারের উপযোগী করতে পারে, সীমাবদ্ধতার মধ্যে গুণমান পরিমাপ করতে পারে, নেটিভ ইনফারেন্স রানটাইম সংযুক্ত করতে পারে এবং কোনো কাজের জন্য কখন ছোট মডেল যথেষ্ট তা নির্ধারণ করতে পারে।
এটি মডেল প্রতিযোগিতার কম আকর্ষণীয় অর্ধেক: শুধু বুদ্ধিমত্তা উন্নত করা নয়, বুদ্ধিমত্তাকে স্থাপনযোগ্য করে তোলা।
ছোট মডেলগুলো কীভাবে স্থাপনের প্রশ্ন বদলে দেয়
একটি ক্লাউড মডেল প্রায়ই কোনো অনুরোধের উত্তর দিতে আরও বেশি কম্পিউট ব্যবহার করতে পারে। একটি এমবেডেড সিস্টেম নির্ভরযোগ্য নেটওয়ার্ক সংযোগ, সীমাহীন ব্যাটারি বা প্রতিটি কলের জন্য উদার বাজেট ধরে নিতে পারে না। প্রতিটি পারসেপশন বা নিয়ন্ত্রণ সিদ্ধান্তের জন্য কয়েক শ মিলিসেকেন্ড অপেক্ষা করা কোনো রোবটকে অনিরাপদ বা অকার্যকর করে তুলতে পারে। প্রতিটি ছবি বা অডিও নমুনা কোনো API-তে পাঠানো কোনো পণ্যে অগ্রহণযোগ্য গোপনীয়তা ও ডেটা-স্থানান্তর ব্যয় তৈরি করতে পারে।
এই সীমাবদ্ধতাগুলো প্রকৌশলগত লক্ষ্য বদলে দেয়। প্রশ্ন হয়ে দাঁড়ায়: প্রকৃত ডিভাইসে প্রয়োজনীয় নির্ভুলতা, লেটেন্সি, মেমরি, শক্তি এবং নির্ভরযোগ্যতার লক্ষ্যমাত্রা পূরণ করতে পারে—এমন সবচেয়ে ছোট মডেল কোনটি?
এই প্রশ্ন ভোক্তা-গ্যাজেটের বহু দূর বাইরেও প্রযোজ্য। উৎপাদন লাইনে যন্ত্রাংশ পরীক্ষা করা নির্মাতাদের, সরঞ্জাম ট্র্যাক করা লজিস্টিকস কোম্পানিগুলোর, সংবেদনশীল সংকেত প্রক্রিয়া করা হাসপাতালগুলোর এবং ইনফারেন্স বিলকে নিজেদের বৃহত্তম পরিবর্তনশীল ব্যয়ে পরিণত না করে AI সুবিধা দেওয়ার চেষ্টা করা সফটওয়্যার বিক্রেতাদের জন্য এটি গুরুত্বপূর্ণ।
এই পরিবর্তনের পেছনে থাকা তিনটি কৌশল
কোয়ান্টাইজেশন মডেলের ওজন এবং কখনও কখনও অ্যাক্টিভেশনকে কম-নির্ভুলতার সংখ্যা দিয়ে উপস্থাপন করে। BF16 বা FP16-এর মতো ফরম্যাট থেকে 8-bit বা 4-bit উপস্থাপনায় গেলে মেমরির প্রয়োজন কমতে পারে এবং হার্ডওয়্যার ও বাস্তবায়নের ওপর নির্ভর করে থ্রুপুট বাড়তে পারে। এর বিনিময়ে কম নির্ভুলতা গুণমান কমাতে বা সংখ্যাগত সমস্যা তৈরি করতে পারে, তাই এটি ক্ষতিহীন ধরে নেওয়ার বদলে পরীক্ষা করতে হবে।
ডিস্টিলেশন একটি ছোট ছাত্র মডেলকে বড় শিক্ষক মডেলের কার্যকর আচরণ পুনরুৎপাদন করতে প্রশিক্ষণ দেয়। ছাত্রটি শিক্ষকের আউটপুট, মধ্যবর্তী সংকেত বা কাজ-নির্দিষ্ট উদাহরণ থেকে শিখতে পারে। বড় মডেলের প্রতিটি সক্ষমতা পুনর্নির্মাণ করার দরকার তার নেই; লক্ষ্য কাজটি যথেষ্ট ভালোভাবে সম্পাদন করতে পারলেই হয়।
অপ্টিমাইজড ইনফারেন্স কোনো নির্দিষ্ট রানটাইম ও প্রসেসরের উপযোগী করে এক্সিকিউশনকে মানিয়ে নেয়। এর মধ্যে কার্নেল নির্বাচন, গ্রাফ কম্পাইলেশন, ব্যাচিং, মেমরি পরিকল্পনা, ক্যাশিং এবং হার্ডওয়্যার-নির্দিষ্ট ত্বরণ থাকতে পারে। প্রকাশ্য প্রিভিউ হিসেবে ঘোষিত NVIDIA-এর TensorRT Model Connect এমন টুলিংয়ের একটি উদাহরণ, যার উদ্দেশ্য মধ্যবর্তী ONNX এক্সপোর্ট ছাড়াই সমর্থিত Hugging Face বা স্থানীয় চেকপয়েন্টকে এন্ড-টু-এন্ড TensorRT ইনফারেন্সে রূপান্তর করা। এর ঘোষিত লক্ষ্যগুলোর মধ্যে রোবোটিক্স, ডিভাইস এবং প্ল্যাটফর্ম ওয়ার্কলোড রয়েছে।
এই কৌশলগুলো একে অপরকে শক্তিশালী করে। ডিস্টিলেশন একটি компакт মডেল তৈরি করতে পারে; কোয়ান্টাইজেশন তার ফুটপ্রিন্ট আরও কমাতে পারে; একটি অপ্টিমাইজড রানটাইম নির্ধারণ করতে পারে, ফলস্বরূপ মডেলটি নির্ধারিত চিপে সত্যিই দ্রুত কি না।
উপযোগী ফলাফল আর শুধু ছোট ফাইলের সমান নয়
মডেল কম্প্রেশনকে লিডারবোর্ডের কৌশল হিসেবে নয়, পণ্য ও সিস্টেম-সংক্রান্ত কাজ হিসেবে দেখা উচিত। একটি মডেল 40 শতাংশ ছোট হলেও খারাপ আলোয় গুরুত্বপূর্ণ বস্তু শনাক্ত করতে না পারলে গুদামের রোবটের জন্য তা আরও খারাপ হতে পারে। প্রতি টোকেনে সস্তা হলেও কোনো ভাষা মডেল যদি বিকৃত কাঠামোবদ্ধ আউটপুট তৈরি করে, তবে পরবর্তী ধাপে মেরামতের কাজ বেড়ে যেতে পারে। কোনো মডেল বেঞ্চমার্কে ভালো করলেও তাপীয় থ্রটলিং, ক্যামেরার নয়েজ, বিচ্ছিন্ন সংযোগ বা অস্বাভাবিক ব্যবহারকারীর ইনপুট যুক্ত হলে তা ব্যর্থ হতে পারে।
এর LFM2.5 ছোট মডেলগুলোর জন্য কোয়ান্টাইজেশন-সচেতন ডিস্টিলেশন নিয়ে Liquid AI-এর প্রতিবেদনটি লক্ষ্যের একটি কার্যকর দৃষ্টান্ত। কোম্পানিটি জানিয়েছে, Q4_0 মেমরি ব্যবহার ও থ্রুপুট বজায় রেখে BF16 পারফরম্যান্সের 96.5% থেকে 97.4% ধরে রাখা গেছে। এই পরিসংখ্যান কোম্পানির প্রতিবেদন এবং নির্দিষ্ট মডেলভিত্তিক; এগুলো প্রতিটি আর্কিটেকচারে সাধারণীকরণ করা উচিত নয়। তবে এগুলো দেখায়, ব্যবহারকারীদের কী ধরনের তুলনা খোঁজা উচিত: শুধু কম্প্রেশন অনুপাত নয়, মেমরি ও গতির পাশাপাশি গুণমান ধরে রাখার পরিমাপ।
কোনো স্থাপনের গ্রহণযোগ্যতা পরীক্ষায় অন্তত অন্তর্ভুক্ত থাকা উচিত:
- প্রতিনিধিত্বশীল, কঠিন উদাহরণে কাজের গুণমান;
- সর্বোচ্চ মেমরি ও স্টোরেজের প্রয়োজনীয়তা;
- প্রথম প্রতিক্রিয়া এবং স্থিতিশীল অবস্থার লেটেন্সি;
- বাস্তবসম্মত সমকালীনতার অধীনে থ্রুপুট;
- প্রাসঙ্গিক ক্ষেত্রে শক্তি ব্যবহার বা তাপীয় আচরণ;
- ইনপুট অনুপস্থিত, নয়েজযুক্ত বা বিতরণ-বহির্ভূত হলে ব্যর্থতার আচরণ;
- মডেল আপডেট করার ব্যয় ও পরিচালনাগত বোঝা।
সঠিক মেট্রিক পণ্যভেদে পরিবর্তিত হয়। একটি ক্যামেরার কাছে প্রতি সেকেন্ডে ফ্রেমের সংখ্যা এবং ফালস নেগেটিভ গুরুত্বপূর্ণ হতে পারে। একটি ভয়েস ইন্টারফেসের কাছে এন্ড-টু-এন্ড প্রতিক্রিয়া সময় গুরুত্বপূর্ণ হতে পারে। একটি রোবটের কাছে নিয়ন্ত্রণ-লুপের সময়সীমা এবং নিরাপদ বিকল্প আচরণ গুরুত্বপূর্ণ হতে পারে। মূল কথা হলো, মডেল মূল্যায়নকে ব্যর্থতার ভৌত বা আর্থিক পরিণতির সঙ্গে যুক্ত করা।
নতুন কাজের ক্ষেত্রগুলো যেখানে তৈরি হচ্ছে
বিস্তৃত হতে থাকা এই সুযোগ কেবল যারা আর্কিটেকচার উদ্ভাবন করেন, তাদের মধ্যে সীমাবদ্ধ নয়। এতে বেশ কয়েকটি ব্যবহারিক ভূমিকাও অন্তর্ভুক্ত রয়েছে:
- ইনফারেন্স ইঞ্জিনিয়াররা লক্ষ্য অ্যাক্সিলারেটরে মডেলের পারফরম্যান্স প্রোফাইল করেন, রানটাইম নির্বাচন করেন, গ্রাফ অপ্টিমাইজ করেন এবং লেটেন্সি বা মেমরির প্রতিবন্ধকতা নির্ণয় করেন।
- মডেল-কম্প্রেশন ইঞ্জিনিয়াররা কোয়ান্টাইজেশন ও ডিস্টিলেশন পাইপলাইন নকশা করেন, ক্যালিব্রেশন ডেটা নির্বাচন করেন এবং কাজ ও সেগমেন্টভেদে গুণমানের ক্ষতি পরিমাপ করেন।
- এজ ML ইঞ্জিনিয়াররা মোবাইল, এমবেডেড, শিল্প বা স্বয়ংচালিত পরিবেশের জন্য মডেল প্যাকেজ করেন এবং সীমিত সংযোগের মধ্যে আপডেট পরিচালনা করেন।
- রোবোটিক্স সফটওয়্যার ইঞ্জিনিয়াররা পারসেপশন মডেলকে সেন্সর, পরিকল্পনা ব্যবস্থা ও নিরাপত্তা-সংক্রান্ত সীমাবদ্ধতার সঙ্গে যুক্ত করেন, যেখানে সময়নির্ভুলতা গুরুত্বপূর্ণ।
- হার্ডওয়্যার-সচেতন প্রোডাক্ট ইঞ্জিনিয়াররা সিদ্ধান্ত নেন কোনো ওয়ার্কলোড ডিভাইসে, এজে, নাকি ক্লাউডে থাকা উচিত—এবং সেগুলোর মধ্যে মসৃণ হস্তান্তরের নকশা করেন।
- ডিপ্লয়মেন্ট ও ভ্যালিডেশন বিশেষজ্ঞরা তাপমাত্রা, শক্তি, নেটওয়ার্ক এবং বাস্তব পরিবেশগত পরিস্থিতি অন্তর্ভুক্ত করে এমন টেস্ট স্যুট তৈরি করেন।
অ্যাপ্লিকেশন ডেভেলপারদের জন্যও কাজ রয়েছে। কোনো প্রোডাক্ট টিম হয়তো মডেল প্রশিক্ষণ দেয় না, কিন্তু তাদের তবু একটি মডেল ফরম্যাট বেছে নিতে, ইনফারেন্স লাইব্রেরি সংযুক্ত করতে, অসমর্থিত অপারেটর সামলাতে, কনফিডেন্স বা বিরত থাকার আচরণ প্রকাশ করতে এবং আপগ্রেডকে প্রত্যাবর্তনযোগ্য রাখতে হয়।
ক্লাউড-এজ বিভাজন একটি নকশাগত দক্ষতায় পরিণত হচ্ছে
ছোট মডেল ক্লাউড মডেলকে অপ্রয়োজনীয় করে না। বরং এগুলো হাইব্রিড সিস্টেমকে আরও আকর্ষণীয় করে তোলে। কোনো ডিভাইস তাৎক্ষণিক শনাক্তকরণের জন্য একটি কমপ্যাক্ট মডেল ব্যবহার করতে পারে, তারপর নির্বাচিত ঘটনাগুলো ব্যাখ্যা বা গভীরতর বিশ্লেষণের জন্য বড় মডেলের কাছে পাঠাতে পারে। কোনো রোবট নিরাপত্তা-সমালোচনামূলক পারসেপশন স্থানীয়ভাবে রাখতে পারে, আর বহরের সামগ্রিক শিক্ষার জন্য ক্লাউড ব্যবহার করতে পারে। কোনো কাস্টমার-সাপোর্ট প্রোডাক্ট নিয়মিত শ্রেণিবিন্যাস ছোট মডেলের কাছে পাঠাতে পারে এবং অস্পষ্ট ঘটনাগুলো আরও সক্ষম মডেলের কাছে স্থানান্তর করতে পারে।
এই আর্কিটেকচার ব্যান্ডউইথ ও লেটেন্সি কমাতে পারে, কিন্তু এতে এমন কিছু সিদ্ধান্তের প্রয়োজন হয় যেগুলোর জন্য স্পষ্ট দায়িত্ব নির্ধারণ করতে হবে। ডিভাইসের বাইরে কোন তথ্য পাঠানো হবে? সংযোগ না থাকলে কী হবে? কোন মডেল সংস্করণ কোনো কাজ সম্পাদন করেছে? ডিভাইস কি নিরাপদে রোলব্যাক করতে পারে? প্রতিটি হার্ডওয়্যার কনফিগারেশন ভিন্নভাবে আচরণ করলে পারফরম্যান্স কীভাবে পর্যবেক্ষণ করা হবে?
এগুলো শুধু মডেল-সংক্রান্ত প্রশ্ন নয়, ডিপ্লয়মেন্ট-সংক্রান্ত প্রশ্ন। যারা মেশিন লার্নিং, এমবেডেড সিস্টেম, নেটওয়ার্কিং, প্রোডাক্টের প্রয়োজনীয়তা এবং অপারেশনের মধ্যকার ইন্টারফেস বোঝেন, তারা এসব ক্ষেত্রে এগিয়ে থাকেন।
একটি ব্যবহারিক শেখার পথ
আপনি যদি এই কাজের দিকে এগোতে চান, তাহলে শুধু মডেল সার্টিফিকেট সংগ্রহ না করে একটি ছোট কিন্তু পরিমাপযোগ্য ডিপ্লয়মেন্ট তৈরি করুন। এমন একটি কাজ দিয়ে শুরু করুন যার লক্ষ্য স্পষ্ট—যেমন ছবি শ্রেণিবিন্যাস, কীওয়ার্ড শনাক্তকরণ, নথি শ্রেণিবিন্যাস, অথবা একটি কমপ্যাক্ট স্থানীয় অ্যাসিস্ট্যান্ট।
- একটি বেসলাইন নির্ধারণ করুন। পুনরুৎপাদনযোগ্য একটি টেস্ট সেট ব্যবহার করে গুণমান, মডেলের আকার, মেমরি ব্যবহার, লেটেন্সি এবং থ্রুপুট রেকর্ড করুন।
- এটিকে কোয়ান্টাইজ করুন। বেসলাইনের সঙ্গে অন্তত একটি নিম্ন-নির্ভুলতার সংস্করণের তুলনা করুন। কোন উদাহরণগুলো বদলেছে এবং গুরুত্বপূর্ণ কোনো শ্রেণিতে ত্রুটিগুলো কেন্দ্রীভূত হচ্ছে কি না, তা নথিবদ্ধ করুন।
- ডিস্টিলেশন বা কাজ-নির্দিষ্ট ফাইন-টিউনিং চেষ্টা করুন। একটি ছোট মডেল প্রোডাক্টের প্রকৃত প্রয়োজনীয় আচরণ ধরে রাখতে পারে কি না, তা পরিমাপ করুন।
- লক্ষ্য হার্ডওয়্যারে এটি চালান। ডেস্কটপের বেঞ্চমার্ক কোনো ফোন, মাইক্রোকম্পিউটার, GPU, অ্যাক্সিলারেটর বা রোবট কম্পিউটার সম্পর্কে প্রমাণ নয়।
- ডিপ্লয়মেন্টটি প্যাকেজ করুন। এতে প্রিপ্রসেসিং, পোস্টপ্রসেসিং, সংস্করণের মেটাডেটা, হেলথ চেক এবং একটি ফলব্যাক পথ অন্তর্ভুক্ত করুন।
- ট্রেড-অফ প্রতিবেদন লিখুন। শুধু কেন এর স্কোর সবচেয়ে ভালো তা নয়, গুণমান, লেটেন্সি, মেমরি, শক্তি, গোপনীয়তা এবং খরচ—সবকিছুর সমন্বয়ে নির্বাচিত মডেলটি কেন সেরা, তা ব্যাখ্যা করুন।
উপযোগী টুল লক্ষ্য স্ট্যাকের ওপর নির্ভর করে, কিন্তু স্থানান্তরযোগ্য দক্ষতাগুলো একই থাকে: প্রোফাইলিং, সংখ্যাগত বিশ্লেষণ, ডেটা নির্বাচন, টেস্ট নকশা, ডিবাগিং এবং ট্রেড-অফ স্পষ্টভাবে যোগাযোগ করা। একটি মডেল গ্রাফ পড়তে, অপারেটর সাপোর্ট পরীক্ষা করতে, মেমরি স্থানান্তরকে প্রতিবন্ধকতা হিসেবে শনাক্ত করতে এবং তাত্ত্বিক কম্পিউটকে পরিমাপ করা এন্ড-টু-এন্ড লেটেন্সি থেকে আলাদা করতে শিখুন।
ক্যারিয়ারের সংকেত
গুরুত্বপূর্ণ ক্যারিয়ার পরিবর্তন হলো, “কোন মডেলটি সবচেয়ে বুদ্ধিমান?”—এই প্রশ্ন থেকে সরে এসে জিজ্ঞেস করা, “বাস্তব সীমাবদ্ধতার মধ্যে কোন সিস্টেমটি প্রয়োজনীয় ফলাফল সরবরাহ করে?” বড় মডেল মূল্যবানই থাকবে, বিশেষ করে উন্মুক্ত পরিসরের যুক্তি ও জটিল জেনারেশনের জন্য। কিন্তু অনেক বাণিজ্যিক ও বাস্তব জগতের কাজ এতটাই নির্দিষ্ট যে একটি কমপ্যাক্ট, দ্রুত এবং ব্যক্তিগত মডেলই ভালো প্রোডাক্ট হতে পারে।
এতে এমন পেশাজীবীদের জন্য সুযোগ তৈরি হয়, যারা গবেষণা ও ডিপ্লয়মেন্টের মধ্যে সেতুবন্ধন করতে পারেন। সবসময় সবচেয়ে বড় মডেল থাকা দলগুলোই বিজয়ী হবে না। বরং সেই দলগুলোও জিততে পারে যারা ওয়ার্কলোড বোঝে, বুদ্ধিমত্তার সঙ্গে কম্প্রেস করে, সততার সঙ্গে বেঞ্চমার্ক করে এবং উপলব্ধ হার্ডওয়্যারে একটি নির্ভরযোগ্য সিস্টেম সরবরাহ করে।
একটি AI ক্যারিয়ারের জন্য এটি একটি দীর্ঘস্থায়ী শিক্ষা: বুদ্ধিমত্তা ডেলিভারেবলের কেবল একটি অংশ। অন্য অংশটি হলো, সেটিকে উপযুক্ত করে তোলা।