LLM-এর জন্য টোকেন সংকোচন: রাউটিংয়ের আগে প্রসঙ্গ খরচ কমান

এলএলএমগুলির জন্য টোকেন সংকোচন মডেলের কাছে পৌঁছানোর আগে প্রম্পট, পুনরুদ্ধার করা প্রসঙ্গ, টুল আউটপুট, চ্যাট ইতিহাস এবং লগ সংকুচিত করার অভ্যাস। এটি রাউটিং, মূল্যায়ন বা ফেইলওভার প্রতিস্থাপন করে না। এটি সেই সিস্টেমগুলিকে পরিষ্কার ইনপুট দিয়ে কাজ করতে সাহায্য করে।.
এটি গুরুত্বপূর্ণ কারণ বেশিরভাগ এআই খরচ এবং বিলম্ব সমস্যা আপনার অ্যাপ্লিকেশন থেকে অনুরোধ ছাড়ার আগেই শুরু হয়। একটি সাপোর্ট বট পুরো টিকিট থ্রেড পাঠাতে পারে যখন শুধুমাত্র তিনটি তথ্য গুরুত্বপূর্ণ। একটি এজেন্ট সম্পূর্ণ টুল প্রতিক্রিয়া পেস্ট করতে পারে যখন এটি শুধুমাত্র একটি স্ট্যাটাস, পরিমাণ এবং পরবর্তী পদক্ষেপের প্রয়োজন। একটি RAG ওয়ার্কফ্লো পাঁচটি অংশ পুনরুদ্ধার করতে পারে যখন একটি সংক্ষিপ্ত উত্তর যথেষ্ট।.
ওপেনএআই ব্যাখ্যা করে যে API ব্যবহার টোকেনে পরিমাপ করা হয়, এবং সেই টোকেনগুলি ইনপুট এবং আউটপুট টেক্সট উভয় থেকেই আসে। দীর্ঘ প্রসঙ্গ বিনামূল্যে প্রসঙ্গ নয়। লক্ষ্য হল মডেলকে ক্ষুধার্ত করা নয়। লক্ষ্য হল সবচেয়ে ছোট প্রসঙ্গ পাঠানো যা এখনও মডেলের প্রয়োজনীয় সিদ্ধান্ত, প্রমাণ এবং সীমাবদ্ধতা সংরক্ষণ করে।.
রাউটিংয়ের আগে টোকেন সংকোচন কেন গুরুত্বপূর্ণ
অনেক দল খরচ অপ্টিমাইজেশনকে একটি মডেল-নির্বাচন সমস্যা হিসাবে মনে করে: সহজ কাজ একটি সস্তা মডেলে পাঠান, কঠিন কাজের জন্য প্রিমিয়াম মডেল সংরক্ষণ করুন এবং একটি প্রদানকারী রুট অবনতি হলে ফেইলওভার ব্যবহার করুন। এটি উপকারী, তবে এটি একটি মৌলিক বিষয় মিস করে: রাউটার শুধুমাত্র আপনি যে অনুরোধটি দেন তা দেখে।.
যদি অনুরোধটি ফুলে যায়, প্রতিটি ডাউনস্ট্রিম সিদ্ধান্ত কঠিন হয়ে যায়। একটি সস্তা মডেল ব্যর্থ হতে পারে কারণ এটি খুব বেশি শব্দ পায়। একটি ফ্রন্টিয়ার মডেল প্রয়োজনীয় বলে মনে হতে পারে কারণ প্রম্পটটি বিশৃঙ্খল। পর্যবেক্ষণ উচ্চ ব্যয় দেখাতে পারে, তবে এড়ানো যায় এমন প্রসঙ্গ যা এটি সৃষ্টি করেছে তা নয়।.
সংকোচন মডেল অ্যাক্সেসের আগে একটি ধাপ যোগ করে: পে-লোড কমান, অভিপ্রায় সংরক্ষণ করুন, তারপর রাউট করুন। শেয়ারএআই-এর মডেল মার্কেটপ্লেস, সেই পরিষ্কার অনুরোধটি তারপর মডেল পছন্দ, মূল্য, বিলম্ব, প্রাপ্যতা এবং এক API জুড়ে রাউটিং প্রয়োজনের বিরুদ্ধে মূল্যায়ন করা যেতে পারে।.
কী সংকুচিত করা উচিত?
প্রতিটি টোকেন একই আচরণের যোগ্য নয়। কিছু টেক্সট নির্দেশনা-গুরুত্বপূর্ণ। কিছু টেক্সট প্রমাণ। কিছু টেক্সট শুধুমাত্র পূর্ববর্তী ধাপের অবশিষ্টাংশ।.
| ইনপুট এলাকা | সংকোচন পদ্ধতি | কী সংরক্ষণ করতে হবে |
|---|---|---|
| চ্যাট ইতিহাস | পুরোনো পালাগুলোকে সারাংশে পরিণত করুন, সিদ্ধান্ত, সীমাবদ্ধতা এবং খোলা প্রশ্নগুলোতে।. | ব্যবহারকারীর উদ্দেশ্য, প্রতিশ্রুতি, নাম, পছন্দ এবং অসমাপ্ত কাজ।. |
| RAG অংশ | সংকীর্ণভাবে পুনরুদ্ধার করুন, পুনরাবৃত্তি সরান এবং বর্তমান প্রশ্নের উত্তর দেয় এমন অংশগুলো বের করুন।. | উদ্ধৃতি, সঠিক তথ্য, বিরোধপূর্ণ প্রমাণ এবং সাম্প্রতিকতার সংকেত।. |
| টুল আউটপুট | দীর্ঘ প্রতিক্রিয়াগুলোকে সংক্ষিপ্ত কাঠামোগত ক্ষেত্রগুলোতে রূপান্তর করুন।. | অবস্থা, আইডি, পরিমাণ, ত্রুটি, টাইমস্ট্যাম্প এবং পরবর্তী পদক্ষেপ।. |
| লগ এবং ট্রেস | পুনরাবৃত্ত ঘটনাগুলোকে গুচ্ছবদ্ধ করুন এবং কেবলমাত্র অস্বাভাবিকতা, সংখ্যা এবং প্রাসঙ্গিক নমুনা রাখুন।. | ত্রুটির ধরণ, ফ্রিকোয়েন্সি, প্রভাবিত পরিষেবা এবং সময়রেখা।. |
| সিস্টেম নির্দেশাবলী | নকল নীতি পাঠ্য সরান এবং স্থিতিশীল নির্দেশাবলীকে কাজ-নির্দিষ্ট প্রসঙ্গ থেকে আলাদা করুন।. | নিরাপত্তা নিয়ম, আউটপুট চুক্তি, ভূমিকা সীমাবদ্ধতা এবং টুল অনুমতি।. |
পাঁচটি ব্যবহারিক সংকোচন পদ্ধতি
১. অবস্থার সারসংক্ষেপ করুন, গদ্য নয়
একটি দুর্বল সারসংক্ষেপ একটি দীর্ঘ কথোপকথনকে একটি ছোট অনুচ্ছেদে পুনর্লিখন করে। একটি কার্যকর সারসংক্ষেপ অপারেশনাল অবস্থা ধরে রাখে: ব্যবহারকারী কী চায়, কী ইতিমধ্যে চেষ্টা করা হয়েছে, কী ব্যর্থ হয়েছে, কী সীমাবদ্ধতা রয়ে গেছে এবং পরবর্তী সিদ্ধান্ত কী।.
এজেন্টদের জন্য, অবস্থার সারসংক্ষেপগুলি নির্ধারিত সীমারেখায় পুনরায় সতেজ করা উচিত: একটি টুল কলের পরে, একটি ব্যবহারকারীর সিদ্ধান্তের পরে, একটি কর্মপ্রবাহ ধাপের পরে, বা মডেল পরিবর্তনের আগে। আইডি, প্রয়োজনীয়তা বা নেতিবাচক সীমাবদ্ধতা সংকুচিত করবেন না।.
২. টুল আউটপুট থেকে ক্ষেত্রগুলি বের করুন
অনেক টুল কল পরবর্তী মডেল ধাপে প্রয়োজনের চেয়ে অনেক বেশি টেক্সট ফেরত দেয়। পুরো প্রতিক্রিয়া পাস করার পরিবর্তে, গুরুত্বপূর্ণ ক্ষেত্রগুলি বের করুন। একটি পেমেন্ট অনুসন্ধান হতে পারে গ্রাহক আইডি, চালানের অবস্থা, ব্যালেন্স, নির্ধারিত তারিখ এবং ঝুঁকির ফ্ল্যাগ। একটি অনুসন্ধান ফলাফল হতে পারে শিরোনাম, ক্যানোনিকাল URL, তারিখ এবং দাবির সমর্থনে একটি বাক্য।.
৩. প্রজন্মের আগে পুনরুদ্ধার ফিল্টার করুন
RAG সিস্টেমগুলি প্রায়ই অনুরূপ অংশ, পুরানো অংশ, বা অংশগুলি যা কীওয়ার্ডের সাথে মেলে কিন্তু উদ্দেশ্যের সাথে নয়, পাঠিয়ে টোকেন নষ্ট করে। একটি সংকোচন স্তর ওভারল্যাপিং অংশগুলি ডুপ্লিকেট করতে পারে, পুরানো প্রসঙ্গ সরিয়ে দিতে পারে এবং শুধুমাত্র বর্তমান প্রশ্নের উত্তর দেয় এমন প্রমাণ রাখতে পারে।.
এটি বিশেষভাবে গুরুত্বপূর্ণ যখন চূড়ান্ত উত্তরের জন্য উদ্ধৃতি প্রয়োজন। প্রসঙ্গ সংকুচিত করুন, তবে উত্তরটি পরে যাচাই করার জন্য পর্যাপ্ত উৎসের বিবরণ সংরক্ষণ করুন।.
৪. কাঠামোগত মধ্যবর্তী আউটপুট ব্যবহার করুন
মুক্ত-ফর্ম মধ্যবর্তী টেক্সট দ্রুত বৃদ্ধি পায়। কাঠামোগত আউটপুট ছোট এবং নিরীক্ষণ করা সহজ থাকে। প্রতিটি সম্ভাব্য ক্রিয়াকে ব্যাখ্যা করার জন্য একটি মডেলকে জিজ্ঞাসা করার পরিবর্তে, এটিকে একটি কমপ্যাক্ট বিকল্প তালিকা ফেরত দিতে বলুন যার মধ্যে ক্ষেত্রগুলি যেমন ক্রিয়া, আত্মবিশ্বাস, কারণ, বাধা সমস্যা এবং প্রয়োজনীয় ইনপুট অন্তর্ভুক্ত।.
৫. প্রম্পট ক্যাশিংকে একটি পৃথক লিভার হিসাবে বিবেচনা করুন
প্রম্পট ক্যাশিং সমর্থিত সিস্টেমগুলিতে পুনরাবৃত্ত প্রিফিক্সগুলির খরচ বা বিলম্ব কমাতে পারে, তবে এটি টোকেন সংকোচনের মতো নয়। ক্যাশ করা টেক্সট এখনও প্রসঙ্গ উইন্ডো স্পেস ব্যবহার করতে পারে এবং এটি এখনও অনুরোধগুলি পরিদর্শন করা কঠিন করে তুলতে পারে। Anthropic-এর প্রসঙ্গ-উইন্ডো এবং প্রম্পট-ক্যাশিং ডকুমেন্টেশনগুলি উপকারী স্মারক যা ক্যাশিং এবং প্রসঙ্গ ডিজাইন সম্পর্কিত কিন্তু ভিন্ন সমস্যাগুলি সমাধান করে।.
ShareAI কর্মপ্রবাহে কম্প্রেশন কোথায় ফিট করে।
ShareAI একটি AI মার্কেটপ্লেস এবং API, যেখানে আপনি নিজেই অ্যাপ্লিকেশন তৈরি করেন না। আপনার অ্যাপ্লিকেশন ব্যবহারকারীর অভিজ্ঞতা, কর্মপ্রবাহের লজিক, প্রসঙ্গ নির্বাচন এবং কম্প্রেশন ধাপের মালিক। ShareAI মডেল-অ্যাক্সেস দিকটি সহায়তা করে: ১৫০+ মডেলের জন্য একটি API, মার্কেটপ্লেস দৃশ্যমানতা, রাউটিং, ফেলওভার এবং ব্যবহার ট্র্যাকিং।.
- কাঁচা ব্যবহারকারী অনুরোধ এবং অ্যাপ্লিকেশন প্রসঙ্গ সংগ্রহ করুন।.
- ডুপ্লিকেট, পুরানো প্রসঙ্গ এবং অপ্রাসঙ্গিক পুনরুদ্ধার ফলাফল সরান।.
- পুরানো কথোপকথনের অবস্থা এবং বিস্তারিত টুল আউটপুট কম্প্রেস করুন।.
- পরিষ্কার করা অনুরোধটি পাঠান। শেয়ারএআই এপিআই.
- মডেল ফিট, মূল্য, লেটেন্সি, প্রাপ্যতা এবং ফ্যালব্যাক প্রয়োজন অনুযায়ী রাউট করুন।.
- প্রতিক্রিয়ার পরে গুণমান, খরচ এবং ব্যর্থতার প্যাটার্ন পরিমাপ করুন।.
নির্মাতাদের জন্য, কম্প্রেশন মনিটাইজেশনকে আরও পরিষ্কার করতে পারে। যদি একটি বিদ্যমান অ্যাপ ShareAI এর মাধ্যমে AI ইনফারেন্স ট্রাফিক রাউট করে, নির্মাতা একটি সারচার্জ বা মার্জিন কনফিগার করতে পারে এবং উৎপন্ন ব্যবহারের উপর ভিত্তি করে মাসিক পেমেন্ট পেতে পারে। পরিষ্কার প্রসঙ্গ সেই রাউট করা ব্যবহারের ব্যাখ্যা গ্রাহকদের কাছে সহজ রাখে কারণ ভারী ব্যবহারকারীরা তাদের উৎপন্ন AI ট্রাফিকের জন্য অর্থ প্রদান করে।.
কম্প্রেশন কাজ করছে কিনা তা কীভাবে পরিমাপ করবেন।
গুণমান বজায় থাকলে কম্প্রেশনই কেবল উপকারী। এটি একটি প্রোডাকশন পরিবর্তনের মতো ট্র্যাক করুন, একটি চতুর প্রম্পট কৌশল নয়।.
- প্রতি অনুরোধে ইনপুট টোকেন: লক্ষ্যযুক্ত কর্মপ্রবাহের জন্য কমে যাওয়া উচিত।.
- আউটপুট গুণমান: প্রতিনিধিত্বমূলক কাজগুলিতে স্থিতিশীল থাকা উচিত।.
- পতন হার: সস্তা রুটগুলি দুর্বল প্রসঙ্গ পাচ্ছে বলে বৃদ্ধি হওয়া উচিত নয়।.
- লেটেন্সি: উন্নতি হওয়া উচিত, অথবা অন্ততপক্ষে যে কোনো প্রিপ্রসেসিং ধাপকে ন্যায্যতা প্রদান করা উচিত।.
- বৃদ্ধি হার: সংকুচিত প্রসঙ্গ ব্যবহারকারীদের বা এজেন্টদের পুনরায় জিজ্ঞাসা করতে বাধ্য করলে তা প্রকাশ করা উচিত।.
- সফল কাজের প্রতি খরচ: কমা উচিত, শুধুমাত্র অনুরোধের প্রতি খরচ নয়।.
একটি ভালো টেস্ট সেটে ছোট প্রম্পট, বড় প্রম্পট, টুল-নির্ভর এজেন্ট কাজ, RAG প্রশ্ন এবং এমন প্রান্তিক ক্ষেত্র অন্তর্ভুক্ত থাকে যেখানে প্রসঙ্গের অভাব ভুল উত্তর সৃষ্টি করতে পারে। সংকুচিত এবং অসংকুচিত রান তুলনা করুন সংকোচনকে ডিফল্ট করার আগে।.
কখন আক্রমণাত্মকভাবে সংকোচন না করা উচিত
সংকোচনের কিছু বিনিময় রয়েছে। এটি সূক্ষ্মতা সরিয়ে দিতে পারে, অনিশ্চয়তা লুকাতে পারে, অথবা প্রমাণকে সমতল করতে পারে যা মডেলের প্রয়োজন। হালকা সংকোচন ব্যবহার করুন যখন সঠিক শব্দগঠন গুরুত্বপূর্ণ, যখন মডেলকে চুক্তি বা নীতিমালার উপর যুক্তি করতে হবে, যখন উদ্ধৃতি সংরক্ষণ করতে হবে, অথবা যখন ব্যবহারকারী স্পষ্টভাবে সম্পূর্ণ উৎস উপাদান চায়।.
সবচেয়ে নিরাপদ প্যাটার্ন হল প্রগতিশীল সংকোচন। আপনার অ্যাপ্লিকেশনে উচ্চ-নিষ্ঠা উৎস উপাদান উপলব্ধ রাখুন, মডেলের কাছে সংক্ষিপ্ত প্রসঙ্গ পাঠান, এবং যখন কাজ যাচাইয়ের প্রয়োজন হয় তখন আবার মূল প্রমাণ পুনরুদ্ধার করুন।.
FAQ: LLM-এর জন্য টোকেন সংকোচন
LLM-এর জন্য টোকেন সংকোচন কী?
LLM-এর জন্য টোকেন সংকোচন মানে একটি মডেল কলের আগে অপ্রয়োজনীয় ইনপুট টেক্সট কমানো, যখন একটি ভালো প্রতিক্রিয়ার জন্য প্রয়োজনীয় তথ্য, নির্দেশনা এবং সীমাবদ্ধতা সংরক্ষণ করা।.
টোকেন কমপ্রেশন কি ছোট মডেল ব্যবহারের সমান?
না। কমপ্রেশন অনুরোধ কমায়। মডেল নির্বাচন নির্ধারণ করে সেই অনুরোধ কোথায় যাবে। সবচেয়ে শক্তিশালী সেটআপ প্রায়ই উভয়ই করে: প্রথমে প্রসঙ্গ কমপ্রেশন করে, তারপর সঠিক মডেলে রাউট করে।.
ShareAI কি স্বয়ংক্রিয়ভাবে প্রম্পট কমপ্রেশন করে?
কমপ্রেশন সাধারণত অ্যাপ্লিকেশন-সাইড ডিজাইনের পছন্দ। ShareAI AI মার্কেটপ্লেস এবং API স্তর প্রদান করে মডেল অ্যাক্সেস, রাউটিং, ফেলওভার এবং ব্যবহার দৃশ্যমানতার জন্য, আপনার অ্যাপ অনুরোধ প্রস্তুত করার পরে।.
কমপ্রেশন কীভাবে LLM খরচ কমাতে সাহায্য করে?
বেশিরভাগ AI API ইনপুট এবং আউটপুট টোকেনের চারপাশে ব্যবহার মূল্য নির্ধারণ করে। যদি আপনি নিরাপদে ইনপুট টোকেন কমাতে পারেন এবং গুণমান স্থিতিশীল রাখতে পারেন, সফল কাজের প্রতি খরচ কমতে পারে।.
টোকেন কমপ্রেশন কি প্রতিক্রিয়া গুণমান ক্ষতিগ্রস্ত করতে পারে?
হ্যাঁ। অতিরিক্ত কমপ্রেশন প্রমাণ, সূক্ষ্মতা বা সীমাবদ্ধতা সরিয়ে ফেলতে পারে। বাস্তব কাজের বিরুদ্ধে কমপ্রেসড প্রম্পট পরীক্ষা করুন এবং উত্তর গুণমান, ফেলব্যাক হার এবং ব্যবহারকারীর সংশোধন পর্যবেক্ষণ করুন।.
নির্মাতাদের কমপ্রেশন সম্পর্কে কী জানা উচিত?
নির্মাতারা যারা বিদ্যমান অ্যাপ থেকে ShareAI এর মাধ্যমে AI ব্যবহার রাউট করেন তারা কমপ্রেশন ব্যবহার করতে পারেন রাউটেড ট্রাফিক পরিষ্কার রাখতে। তারা এখনও সারচার্জ বা মার্জিন সেট করতে পারেন এবং উৎপন্ন ব্যবহারের মাসিক পেমেন্ট পেতে পারেন।.
RAG এর জন্য টোকেন কমপ্রেশন কি উপকারী?
হ্যাঁ। RAG সিস্টেম প্রায়ই অতিরিক্ত বা দুর্বলভাবে প্রাসঙ্গিক অংশ পাঠায়। কমপ্রেশন ডুপ্লিকেট, ফিল্টার এবং বর্তমান প্রশ্নের উত্তর দেয় এমন অংশগুলি বের করতে পারে।.
প্রম্পট ক্যাশিং কি কমপ্রেশনের বিকল্প?
না। প্রম্পট ক্যাশিং সমর্থিত সিস্টেমে পুনরাবৃত্ত প্রিফিক্সের ক্ষেত্রে সাহায্য করতে পারে, কিন্তু যখন প্রসঙ্গ গোলমালপূর্ণ, পুরানো, ডুপ্লিকেট বা কাজের জন্য খুব বড় হয় তখন কমপ্রেশন এখনও গুরুত্বপূর্ণ।.
কোন দলগুলি টোকেন কমপ্রেশন থেকে সবচেয়ে বেশি উপকৃত হয়?
দীর্ঘ চ্যাট ইতিহাস, টুল-নির্ভর এজেন্ট, ডকুমেন্ট ওয়ার্কফ্লো, সাপোর্ট অটোমেশন, গবেষণা সহকারী এবং RAG সিস্টেম সহ দলগুলি সাধারণত কম্প্রেশনের জন্য সবচেয়ে স্পষ্ট প্রয়োজন দেখতে পায়।.
আমি কীভাবে কম্প্রেশন পরীক্ষা শুরু করব?
একটি ব্যয়বহুল ওয়ার্কফ্লো নির্বাচন করুন, প্রতিনিধিত্বমূলক অনুরোধগুলি সংগ্রহ করুন, সংকুচিত সংস্করণ তৈরি করুন এবং টোকেন ব্যবহার, উত্তর গুণমান, লেটেন্সি এবং সফল কাজের প্রতি খরচ তুলনা করুন।.
কম্প্রেশন কীভাবে AI রাউটিংয়ের সাথে কাজ করে?
কম্প্রেশন একটি পরিষ্কার অনুরোধ প্রস্তুত করে। রাউটিং সেই অনুরোধের জন্য মূল্য, লেটেন্সি, প্রাপ্যতা, নির্ভরযোগ্যতা এবং গুণমানের প্রয়োজনের উপর ভিত্তি করে সেরা মডেল বা প্রদানকারী রুট নির্ধারণ করে।.
পরবর্তী ধাপ
একটি ওয়ার্কফ্লো দিয়ে শুরু করুন যেখানে প্রসঙ্গের অতিরিক্ততা দৃশ্যমান। গোলমাল অংশগুলি সংকুচিত করুন, গুরুত্বপূর্ণ প্রমাণগুলি রাখুন, তারপর ShareAI ব্যবহার করে একটি API এর মাধ্যমে মডেল রুটগুলি তুলনা করুন। ব্যবহারিক লক্ষ্য সহজ: কম অপচয় টোকেন, কম এড়ানোযোগ্য এসকেলেশন এবং পরিষ্কার ব্যবহার ডেটা।.