فشردهسازی توکن برای LLMها: کاهش هزینه زمینه قبل از مسیریابی

فشردهسازی توکن برای LLMها عملی است که شامل کوچک کردن درخواستها، زمینههای بازیابیشده، خروجی ابزارها، تاریخچه چت و گزارشها قبل از رسیدن به مدل میشود. این جایگزین مسیریابی، ارزیابی یا بازیابی نمیشود. این سیستمها را با ورودیهای پاکتر کارآمدتر میکند.
این مهم است زیرا بیشتر مشکلات هزینه و تأخیر هوش مصنوعی قبل از اینکه درخواست از برنامه شما خارج شود شروع میشود. یک ربات پشتیبانی ممکن است یک رشته کامل از تیکتها را ارسال کند در حالی که فقط سه واقعیت مهم هستند. یک عامل ممکن است پاسخ کامل ابزار را کپی کند در حالی که فقط به وضعیت، مقدار و اقدام بعدی نیاز دارد. یک جریان کاری RAG ممکن است پنج بخش را بازیابی کند در حالی که یک پاسخ فشرده کافی است.
OpenAI توضیح میدهد که استفاده از API بر اساس توکنها اندازهگیری میشود، و این توکنها از متن ورودی و خروجی میآیند. زمینه طولانی، زمینه رایگان نیست. هدف گرسنه نگه داشتن مدل نیست. هدف ارسال کوچکترین زمینهای است که همچنان تصمیم، شواهد و محدودیتهایی که مدل نیاز دارد را حفظ کند.
چرا فشردهسازی توکن قبل از مسیریابی مهم است
بسیاری از تیمها بهینهسازی هزینه را به عنوان یک مشکل انتخاب مدل میبینند: ارسال کار آسان به یک مدل ارزانتر، ذخیره مدلهای پریمیوم برای کار سختتر، و استفاده از بازیابی زمانی که مسیر ارائهدهنده خراب میشود. این مفید است، اما یک نکته اساسی را از دست میدهد: مسیریاب فقط درخواستهایی را میبیند که به آن میدهید.
اگر درخواست پرحجم باشد، هر تصمیم پاییندستی سختتر میشود. یک مدل ارزان ممکن است شکست بخورد زیرا نویز زیادی دریافت میکند. یک مدل پیشرفته ممکن است ضروری به نظر برسد زیرا درخواست شلوغ است. قابلیت مشاهده ممکن است هزینه بالا را نشان دهد، اما نه زمینه قابل اجتنابی که باعث آن شده است.
فشردهسازی یک مرحله قبل از دسترسی به مدل اضافه میکند: کاهش بار، حفظ قصد، سپس مسیریابی. با بازار مدل ShareAI استفاده کنید, ، آن درخواست پاکتر سپس میتواند بر اساس انتخاب مدل، قیمت، تأخیر، دسترسی و نیازهای مسیریابی در یک API ارزیابی شود.
چه چیزی باید فشرده شود؟
هر توکن شایسته یکسانی نیست. برخی متنها برای دستورالعمل حیاتی هستند. برخی متنها شواهد هستند. برخی متنها فقط باقیماندهای از مراحل قبلی هستند.
| منطقه ورودی | رویکرد فشردهسازی | چه چیزی را باید حفظ کرد |
|---|---|---|
| تاریخچه چت | خلاصه کردن مکالمات قدیمی به حالت، تصمیمات، محدودیتها و سوالات باز. | قصد کاربر، تعهدات، نامها، ترجیحات و وظایف حلنشده. |
| بخشهای RAG | بازیابی محدود، حذف موارد تکراری و استخراج بخشهایی که به سوال فعلی پاسخ میدهند. | استنادها، حقایق دقیق، شواهد متناقض و سیگنالهای تازگی. |
| خروجی ابزارها | تبدیل پاسخهای طولانی به فیلدهای ساختاریافته فشرده. | وضعیت، شناسهها، مقادیر، خطاها، زمانبندیها و اقدامات بعدی. |
| گزارشها و ردپاها | خوشهبندی رویدادهای تکراری و نگهداشتن فقط موارد غیرعادی، تعداد و نمونه مرتبط. | الگوی خطا، فراوانی، سرویس تحت تأثیر و جدول زمانی. |
| دستورالعملهای سیستم | حذف متنهای سیاست تکراری و جدا کردن دستورالعملهای پایدار از زمینه خاص وظیفه. | قوانین ایمنی، قرارداد خروجی، محدودیتهای نقش و مجوزهای ابزار. |
پنج روش عملی فشردهسازی
1. خلاصهسازی وضعیت، نه نثر
یک خلاصه ضعیف یک مکالمه طولانی را به یک پاراگراف کوتاهتر بازنویسی میکند. یک خلاصه مفید وضعیت عملیاتی را حفظ میکند: آنچه کاربر میخواهد، آنچه قبلاً امتحان شده، آنچه شکست خورده، محدودیتهای باقیمانده، و تصمیم بعدی چیست.
برای عوامل، خلاصههای وضعیت باید در مرزهای مشخص تازهسازی شوند: پس از یک تماس ابزار، پس از تصمیم کاربر، پس از یک مرحله جریان کاری، یا قبل از تغییر مدلها. شناسهها، نیازمندیها، یا محدودیتهای منفی را فشرده نکنید.
2. استخراج فیلدها از خروجیهای ابزار
بسیاری از تماسهای ابزار متن بیشتری از آنچه مرحله بعدی مدل نیاز دارد بازمیگردانند. به جای ارسال کل پاسخ، فیلدهای مهم را استخراج کنید. یک جستجوی پرداخت ممکن است به شناسه مشتری، وضعیت فاکتور، موجودی، تاریخ سررسید، و پرچمهای ریسک تبدیل شود. یک نتیجه جستجو ممکن است به عنوان، URL اصلی، تاریخ، و یک جمله که ادعا را پشتیبانی میکند تبدیل شود.
3. فیلتر کردن بازیابی قبل از تولید
سیستمهای RAG اغلب با ارسال بخشهای مشابه، بخشهای قدیمی، یا بخشهایی که با کلمات کلیدی مطابقت دارند اما با قصد مطابقت ندارند، توکنها را هدر میدهند. یک لایه فشردهسازی میتواند بخشهای همپوشان را حذف کند، زمینههای قدیمی را حذف کند، و فقط شواهدی را که به پرسش فعلی پاسخ میدهد نگه دارد.
این بهویژه زمانی مهم است که پاسخ نهایی نیاز به استناد داشته باشد. زمینه را فشرده کنید، اما جزئیات منبع کافی را برای تأیید پاسخ بعداً حفظ کنید.
4. استفاده از خروجیهای میانی ساختاریافته
متن میانی آزاد به سرعت رشد میکند. خروجیهای ساختاریافته کوچکتر و آسانتر برای بررسی باقی میمانند. به جای درخواست از یک مدل برای توضیح هر اقدام پیشنهادی، از آن بخواهید یک لیست فشرده از گزینهها با فیلدهایی مانند اقدام، اعتماد، دلیل، مسئله مسدودکننده، و ورودی مورد نیاز بازگرداند.
5. کش کردن درخواستها را به عنوان یک اهرم جداگانه در نظر بگیرید
کش کردن درخواستها میتواند هزینه یا تأخیر پیشوندهای تکراری در سیستمهای پشتیبانیشده را کاهش دهد، اما این همان فشردهسازی توکن نیست. متن کششده هنوز میتواند فضای پنجره زمینه را مصرف کند و هنوز میتواند درخواستها را سختتر برای بررسی کند. Anthropic’s و context-window مستندات یادآوریهای مفیدی هستند که طراحی کش و زمینه مشکلات مرتبط اما متفاوت را حل میکنند.
جایی که فشردهسازی در جریان کاری ShareAI قرار میگیرد
ShareAI یک بازار و API هوش مصنوعی است، نه مکانی که در آن خود برنامه را بسازید. برنامه شما مالک تجربه کاربری، منطق جریان کاری، انتخاب زمینه و مرحله فشردهسازی است. ShareAI در بخش دسترسی به مدل کمک میکند: یک API برای بیش از 150 مدل، دیده شدن در بازار، مسیریابی، پشتیبانگیری و ردیابی استفاده.
- درخواست خام کاربر و زمینه برنامه را جمعآوری کنید.
- موارد تکراری، زمینههای قدیمی و نتایج بازیابی غیرمرتبط را حذف کنید.
- وضعیت مکالمه قدیمیتر و خروجیهای ابزار مفصل را فشرده کنید.
- درخواست پاکشده را ارسال کنید از طریق رابط برنامهنویسی ShareAI.
- بر اساس تناسب مدل، قیمت، تأخیر، در دسترس بودن و نیازهای پشتیبانگیری مسیریابی کنید.
- کیفیت، هزینه و الگوهای شکست را پس از پاسخ اندازهگیری کنید.
برای سازندگان، فشردهسازی میتواند کسب درآمد را نیز تمیزتر کند. اگر یک برنامه موجود ترافیک استنتاج هوش مصنوعی را از طریق ShareAI مسیریابی کند، سازنده میتواند یک هزینه اضافی یا حاشیه تنظیم کند و پرداختهای ماهانه را بر اساس استفاده تولید شده دریافت کند. زمینه تمیزتر کمک میکند تا استفاده مسیریابیشده برای مشتریان راحتتر توضیح داده شود زیرا کاربران سنگین برای ترافیک هوش مصنوعی که واقعاً تولید میکنند پرداخت میکنند.
چگونه اندازهگیری کنیم که آیا فشردهسازی کار میکند
فشردهسازی فقط زمانی مفید است که کیفیت حفظ شود. آن را مانند یک تغییر تولید ردیابی کنید، نه یک ترفند هوشمندانه در درخواست.
- توکنهای ورودی در هر درخواست: باید برای جریانهای کاری هدفمند کاهش یابد.
- کیفیت خروجی: باید در وظایف نماینده پایدار باقی بماند.
- نرخ بازگشت: نباید افزایش یابد زیرا مسیرهای ارزانتر زمینه ضعیفتری دریافت میکنند.
- تأخیر: باید بهبود یابد یا حداقل هر مرحله پیشپردازش را توجیه کند.
- نرخ تشدید: باید نشان دهد زمانی که زمینه فشرده کاربران یا عوامل را مجبور به پرسیدن دوباره میکند.
- هزینه به ازای وظیفه موفق: باید کاهش یابد، نه فقط هزینه به ازای درخواست.
یک مجموعه آزمایشی خوب شامل درخواستهای کوتاه، درخواستهای طولانی، وظایف عامل با ابزار زیاد، سوالات RAG و موارد خاصی است که در آن فقدان زمینه باعث پاسخ اشتباه میشود. قبل از اینکه فشردهسازی را به حالت پیشفرض تبدیل کنید، اجرای فشرده و غیر فشرده را مقایسه کنید.
زمانی که نباید به طور تهاجمی فشردهسازی کرد
فشردهسازی دارای معاوضههایی است. میتواند ظرافت را حذف کند، عدم قطعیت را پنهان کند، یا شواهدی را که مدل نیاز دارد، صاف کند. از فشردهسازی سبکتر استفاده کنید زمانی که کلمات دقیق اهمیت دارند، زمانی که مدل باید بر قراردادها یا سیاستها استدلال کند، زمانی که استنادها باید حفظ شوند، یا زمانی که کاربر به طور صریح درخواست مواد منبع جامع میکند.
الگوی ایمنتر فشردهسازی تدریجی است. مواد منبع با کیفیت بالا را در برنامه خود در دسترس نگه دارید، زمینه فشرده را به مدل منتقل کنید و شواهد اصلی را دوباره زمانی که وظیفه نیاز به تأیید دارد، بازیابی کنید.
سوالات متداول: فشردهسازی توکن برای LLMها
فشردهسازی توکن برای LLMها چیست؟
فشردهسازی توکن برای LLMها به معنای کاهش متن ورودی غیرضروری قبل از فراخوانی مدل است، در حالی که حقایق، دستورالعملها و محدودیتهای لازم برای پاسخ خوب حفظ میشود.
آیا فشردهسازی توکن همان استفاده از یک مدل کوچکتر است؟
خیر. فشردهسازی درخواست را کاهش میدهد. انتخاب مدل تعیین میکند که این درخواست به کجا برود. قویترین تنظیمات اغلب هر دو را انجام میدهند: ابتدا متن را فشرده میکنند، سپس به مدل مناسب هدایت میکنند.
آیا ShareAI بهطور خودکار درخواستها را فشرده میکند؟
فشردهسازی معمولاً یک انتخاب طراحی در سمت برنامه است. ShareAI بازار هوش مصنوعی و لایه API را برای دسترسی به مدل، مسیریابی، پشتیبانی و مشاهده استفاده پس از آمادهسازی درخواست توسط برنامه شما فراهم میکند.
فشردهسازی چگونه به کاهش هزینههای LLM کمک میکند؟
بیشتر APIهای هوش مصنوعی هزینه استفاده را بر اساس توکنهای ورودی و خروجی تعیین میکنند. اگر بتوانید توکنهای ورودی را با حفظ کیفیت بهطور ایمن کاهش دهید، هزینه هر وظیفه موفق میتواند کاهش یابد.
آیا فشردهسازی توکن میتواند به کیفیت پاسخ آسیب برساند؟
بله. فشردهسازی بیش از حد میتواند شواهد، جزئیات یا محدودیتها را حذف کند. درخواستهای فشردهشده را در برابر وظایف واقعی آزمایش کنید و کیفیت پاسخ، نرخ بازگشت و اصلاحات کاربران را نظارت کنید.
سازندگان باید درباره فشردهسازی چه بدانند؟
سازندگانی که استفاده از هوش مصنوعی را از یک برنامه موجود از طریق ShareAI هدایت میکنند، میتوانند از فشردهسازی برای تمیزتر نگهداشتن ترافیک هدایتشده استفاده کنند. آنها همچنان میتوانند یک هزینه اضافی یا حاشیه تعیین کنند و پرداختهای ماهانه از استفاده تولیدشده دریافت کنند.
آیا فشردهسازی توکن برای RAG مفید است؟
بله. سیستمهای RAG اغلب بخشهای تکراری یا کمارتباط ارسال میکنند. فشردهسازی میتواند بخشهای تکراری را حذف، فیلتر و قسمتهایی که به سؤال فعلی پاسخ میدهند را استخراج کند.
آیا کش کردن درخواست جایگزینی برای فشردهسازی است؟
خیر. کش کردن درخواست میتواند در سیستمهای پشتیبانیشده با پیشوندهای تکراری کمک کند، اما فشردهسازی همچنان زمانی اهمیت دارد که متن پر از نویز، قدیمی، تکراری یا بیش از حد بزرگ برای وظیفه باشد.
کدام تیمها بیشترین بهره را از فشردهسازی توکن میبرند؟
تیمهایی با تاریخچه طولانی چت، عوامل سنگین ابزار، جریانهای کاری اسناد، خودکارسازی پشتیبانی، دستیاران تحقیق و سیستمهای RAG معمولاً نیاز واضحتری به فشردهسازی دارند.
چگونه باید آزمایش فشردهسازی را شروع کنم؟
یک جریان کاری پرهزینه را انتخاب کنید، درخواستهای نماینده را ضبط کنید، نسخههای فشرده ایجاد کنید و استفاده از توکن، کیفیت پاسخ، تأخیر و هزینه هر وظیفه موفق را مقایسه کنید.
فشردهسازی چگونه با مسیریابی هوش مصنوعی کار میکند؟
فشردهسازی یک درخواست پاکتر آماده میکند. مسیریابی بهترین مدل یا مسیر ارائهدهنده را برای آن درخواست بر اساس قیمت، تأخیر، در دسترس بودن، قابلیت اطمینان و نیازهای کیفیت تعیین میکند.
مرحله بعد
با یک جریان کاری شروع کنید که تورم زمینه در آن قابل مشاهده است. بخشهای پر سر و صدا را فشرده کنید، شواهد مهم را نگه دارید، سپس از ShareAI برای مقایسه مسیرهای مدل از طریق یک API استفاده کنید. هدف عملی ساده است: توکنهای کمتر هدر رفته، تشدیدهای قابل اجتناب کمتر و دادههای استفاده واضحتر.