Nén Token cho LLMs: Giảm Chi Phí Ngữ Cảnh Trước Khi Định Tuyến

Nén token cho LLMs là thực hành thu nhỏ các lời nhắc, ngữ cảnh được truy xuất, đầu ra công cụ, lịch sử trò chuyện và nhật ký trước khi chúng đến mô hình. Nó không thay thế định tuyến, đánh giá hoặc chuyển đổi dự phòng. Nó làm cho các hệ thống đó hoạt động với đầu vào sạch hơn.
Điều đó quan trọng vì hầu hết các vấn đề về chi phí và độ trễ của AI bắt đầu trước khi yêu cầu rời khỏi ứng dụng của bạn. Một bot hỗ trợ có thể gửi toàn bộ chuỗi vé khi chỉ có ba thông tin quan trọng. Một tác nhân có thể dán toàn bộ phản hồi công cụ khi chỉ cần trạng thái, số lượng và hành động tiếp theo. Một quy trình làm việc RAG có thể truy xuất năm đoạn khi một câu trả lời ngắn gọn là đủ.
OpenAI giải thích rằng việc sử dụng API được đo lường bằng token, và các token đó đến từ cả văn bản đầu vào và đầu ra. Ngữ cảnh dài không phải là ngữ cảnh miễn phí. Mục tiêu không phải là làm mô hình thiếu dữ liệu. Mục tiêu là gửi ngữ cảnh nhỏ nhất mà vẫn giữ được quyết định, bằng chứng và ràng buộc mà mô hình cần.
Tại sao nén token quan trọng trước khi định tuyến
Nhiều nhóm nghĩ rằng tối ưu hóa chi phí là một vấn đề lựa chọn mô hình: gửi công việc dễ dàng đến một mô hình rẻ hơn, dành các mô hình cao cấp cho công việc khó hơn và sử dụng chuyển đổi dự phòng khi một tuyến nhà cung cấp bị suy giảm. Điều đó hữu ích, nhưng nó bỏ qua một điểm cơ bản: bộ định tuyến chỉ nhìn thấy yêu cầu bạn đưa cho nó.
Nếu yêu cầu bị phình to, mọi quyết định hạ nguồn sẽ trở nên khó khăn hơn. Một mô hình rẻ có thể thất bại vì nhận quá nhiều nhiễu. Một mô hình tiên tiến có thể trông cần thiết vì lời nhắc bị lộn xộn. Khả năng quan sát có thể cho thấy chi phí cao, nhưng không phải là ngữ cảnh có thể tránh được đã gây ra điều đó.
Nén thêm một bước trước khi truy cập mô hình: giảm tải, giữ nguyên ý định, sau đó định tuyến. Với thị trường mô hình của ShareAI, yêu cầu sạch hơn đó sau đó có thể được đánh giá dựa trên lựa chọn mô hình, giá cả, độ trễ, tính khả dụng và nhu cầu định tuyến trên một API.
Những gì nên được nén?
Không phải mọi token đều xứng đáng được xử lý như nhau. Một số văn bản là quan trọng cho hướng dẫn. Một số văn bản là bằng chứng. Một số văn bản chỉ là dư thừa từ các bước trước đó.
| Khu vực đầu vào | Phương pháp nén | Những gì cần giữ lại |
|---|---|---|
| Lịch sử trò chuyện | Tóm tắt các lượt cũ thành trạng thái, quyết định, ràng buộc và câu hỏi mở. | Ý định của người dùng, cam kết, tên, sở thích và nhiệm vụ chưa được giải quyết. |
| Các đoạn RAG | Truy xuất hẹp, loại bỏ trùng lặp và trích xuất các đoạn văn trả lời câu hỏi hiện tại. | Trích dẫn, sự thật chính xác, bằng chứng mâu thuẫn và tín hiệu mới mẻ. |
| Kết quả công cụ | Chuyển đổi các phản hồi dài dòng thành các trường cấu trúc gọn gàng. | Trạng thái, ID, số lượng, lỗi, dấu thời gian và hành động tiếp theo. |
| Nhật ký và dấu vết | Gom nhóm các sự kiện lặp lại và chỉ giữ lại sự bất thường, số lượng và mẫu liên quan. | Mẫu lỗi, tần suất, dịch vụ bị ảnh hưởng và dòng thời gian. |
| Hướng dẫn hệ thống | Loại bỏ văn bản chính sách trùng lặp và tách hướng dẫn ổn định khỏi ngữ cảnh cụ thể của nhiệm vụ. | Quy tắc an toàn, hợp đồng đầu ra, ràng buộc vai trò và quyền công cụ. |
Năm phương pháp nén thực tiễn
1. Tóm tắt trạng thái, không phải văn xuôi
Một bản tóm tắt yếu kém viết lại một cuộc trò chuyện dài thành một đoạn ngắn hơn. Một bản tóm tắt hữu ích giữ lại trạng thái hoạt động: người dùng muốn gì, đã thử những gì, điều gì đã thất bại, những ràng buộc nào còn lại, và quyết định tiếp theo là gì.
Đối với các tác nhân, các bản tóm tắt trạng thái nên được làm mới tại các ranh giới đã biết: sau một lần gọi công cụ, sau một quyết định của người dùng, sau một bước quy trình làm việc, hoặc trước khi chuyển đổi mô hình. Không nén bỏ ID, yêu cầu, hoặc các ràng buộc tiêu cực.
2. Trích xuất các trường từ đầu ra của công cụ
Nhiều lần gọi công cụ trả về nhiều văn bản hơn mức cần thiết cho bước mô hình tiếp theo. Thay vì chuyển toàn bộ phản hồi, hãy trích xuất các trường quan trọng. Một tra cứu thanh toán có thể trở thành ID khách hàng, trạng thái hóa đơn, số dư, ngày đến hạn, và các cờ rủi ro. Một kết quả tìm kiếm có thể trở thành tiêu đề, URL chuẩn, ngày, và một câu hỗ trợ tuyên bố.
3. Lọc truy xuất trước khi tạo
Các hệ thống RAG thường lãng phí token bằng cách gửi các đoạn tương tự, các đoạn cũ, hoặc các đoạn khớp từ khóa nhưng không khớp ý định. Một lớp nén có thể loại bỏ các đoạn trùng lặp, xóa ngữ cảnh cũ, và chỉ giữ lại bằng chứng trả lời truy vấn hiện tại.
Điều này đặc biệt quan trọng khi câu trả lời cuối cùng cần trích dẫn. Nén ngữ cảnh, nhưng giữ lại đủ chi tiết nguồn để xác minh câu trả lời sau này.
4. Sử dụng đầu ra trung gian có cấu trúc
Văn bản trung gian tự do phát triển nhanh chóng. Đầu ra có cấu trúc giữ kích thước nhỏ hơn và dễ kiểm tra hơn. Thay vì yêu cầu một mô hình giải thích mọi hành động ứng viên, hãy yêu cầu nó trả về một danh sách tùy chọn gọn gàng với các trường như hành động, độ tin cậy, lý do, vấn đề cản trở, và đầu vào cần thiết.
5. Xem bộ nhớ đệm gợi ý như một đòn bẩy riêng biệt
Bộ nhớ đệm gợi ý có thể giảm chi phí hoặc độ trễ của các tiền tố lặp lại trong các hệ thống được hỗ trợ, nhưng nó không giống như nén token. Văn bản được lưu trong bộ nhớ đệm vẫn có thể tiêu tốn không gian cửa sổ ngữ cảnh, và nó vẫn có thể làm cho các yêu cầu khó kiểm tra hơn. Anthropic’s cửa sổ ngữ cảnh và lưu trữ nhắc nhở tài liệu là những lời nhắc hữu ích rằng bộ nhớ đệm và thiết kế ngữ cảnh giải quyết các vấn đề liên quan nhưng khác nhau.
Nén dữ liệu nằm ở đâu trong quy trình làm việc của ShareAI
ShareAI là một thị trường và API AI, không phải là nơi bạn xây dựng chính ứng dụng. Ứng dụng của bạn sở hữu trải nghiệm người dùng, logic quy trình làm việc, lựa chọn ngữ cảnh và bước nén dữ liệu. ShareAI hỗ trợ phần truy cập mô hình: một API cho hơn 150 mô hình, khả năng hiển thị trên thị trường, định tuyến, chuyển đổi dự phòng và theo dõi sử dụng.
- Thu thập yêu cầu thô của người dùng và ngữ cảnh ứng dụng.
- Loại bỏ các bản sao, ngữ cảnh cũ và kết quả truy xuất không liên quan.
- Nén trạng thái hội thoại cũ và các đầu ra công cụ chi tiết.
- Gửi yêu cầu đã được làm sạch qua API ShareAI.
- Định tuyến theo sự phù hợp của mô hình, giá cả, độ trễ, tính khả dụng và nhu cầu dự phòng.
- Đo lường chất lượng, chi phí và các mẫu lỗi sau khi nhận phản hồi.
Đối với Người xây dựng, nén dữ liệu cũng có thể làm cho việc kiếm tiền trở nên rõ ràng hơn. Nếu một ứng dụng hiện có định tuyến lưu lượng suy luận AI qua ShareAI, Người xây dựng có thể cấu hình phụ phí hoặc biên lợi nhuận và nhận thanh toán hàng tháng dựa trên mức sử dụng được tạo ra. Ngữ cảnh rõ ràng hơn giúp việc giải thích lưu lượng sử dụng được định tuyến đó dễ dàng hơn với khách hàng vì người dùng nặng trả tiền cho lưu lượng AI mà họ thực sự tạo ra.
Cách đo lường liệu nén dữ liệu có hoạt động hay không
Nén dữ liệu chỉ hữu ích nếu chất lượng được giữ vững. Theo dõi nó như một thay đổi sản xuất, không phải một mẹo nhắc thông minh.
- Số lượng token đầu vào trên mỗi yêu cầu: nên giảm đối với các quy trình làm việc mục tiêu.
- Chất lượng đầu ra: nên duy trì ổn định trên các nhiệm vụ đại diện.
- Tỷ lệ dự phòng: không nên tăng vì các tuyến đường rẻ hơn đang nhận được ngữ cảnh yếu hơn.
- Độ trễ: nên cải thiện, hoặc ít nhất biện minh cho bất kỳ bước tiền xử lý nào.
- Tỷ lệ leo thang: nên tiết lộ khi ngữ cảnh nén buộc người dùng hoặc tác nhân phải hỏi lại.
- Chi phí cho mỗi nhiệm vụ thành công: nên giảm, không chỉ chi phí cho mỗi yêu cầu.
Một bộ kiểm tra tốt bao gồm các lời nhắc ngắn, lời nhắc dài, nhiệm vụ tác nhân nặng công cụ, câu hỏi RAG, và các trường hợp ngoại lệ nơi thiếu ngữ cảnh sẽ gây ra câu trả lời sai. So sánh các lần chạy nén và không nén trước khi đặt nén làm mặc định.
Khi không nên nén mạnh
Nén có những đánh đổi. Nó có thể loại bỏ sắc thái, che giấu sự không chắc chắn, hoặc làm phẳng bằng chứng mà mô hình cần. Sử dụng nén nhẹ hơn khi từ ngữ chính xác quan trọng, khi mô hình phải suy luận về hợp đồng hoặc chính sách, khi trích dẫn phải được bảo tồn, hoặc khi người dùng yêu cầu rõ ràng tài liệu nguồn đầy đủ.
Mẫu an toàn nhất là nén tiến bộ. Giữ tài liệu nguồn có độ trung thực cao sẵn có trong ứng dụng của bạn, truyền ngữ cảnh gọn nhẹ đến mô hình, và truy xuất lại bằng chứng gốc khi nhiệm vụ yêu cầu xác minh.
Câu hỏi thường gặp: Nén token cho LLMs
Nén token cho LLMs là gì?
Nén token cho LLMs nghĩa là giảm văn bản đầu vào không cần thiết trước khi gọi mô hình trong khi vẫn giữ nguyên các sự kiện, hướng dẫn, và ràng buộc cần thiết cho một phản hồi tốt.
Nén token có giống như sử dụng một mô hình nhỏ hơn không?
Không. Nén giảm yêu cầu. Lựa chọn mô hình quyết định nơi yêu cầu đó được gửi đến. Cách thiết lập mạnh nhất thường làm cả hai: nén ngữ cảnh trước, sau đó định tuyến đến mô hình phù hợp.
ShareAI có tự động nén các lời nhắc không?
Nén thường là một lựa chọn thiết kế phía ứng dụng. ShareAI cung cấp thị trường AI và lớp API để truy cập mô hình, định tuyến, chuyển đổi dự phòng và hiển thị sử dụng sau khi ứng dụng của bạn chuẩn bị yêu cầu.
Nén giúp giảm chi phí LLM như thế nào?
Hầu hết các API AI định giá sử dụng dựa trên các token đầu vào và đầu ra. Nếu bạn giảm an toàn các token đầu vào trong khi giữ chất lượng ổn định, chi phí cho mỗi nhiệm vụ thành công có thể giảm.
Nén token có thể làm giảm chất lượng phản hồi không?
Có. Nén quá mức có thể loại bỏ bằng chứng, sắc thái hoặc ràng buộc. Kiểm tra các lời nhắc đã nén với các nhiệm vụ thực tế và theo dõi chất lượng câu trả lời, tỷ lệ chuyển đổi dự phòng và các chỉnh sửa của người dùng.
Các nhà xây dựng nên biết gì về nén?
Các nhà xây dựng định tuyến việc sử dụng AI từ một ứng dụng hiện có thông qua ShareAI có thể sử dụng nén để giữ lưu lượng định tuyến sạch hơn. Họ vẫn có thể đặt phụ phí hoặc biên lợi nhuận và nhận thanh toán hàng tháng từ việc sử dụng được tạo ra.
Nén token có hữu ích cho RAG không?
Có. Các hệ thống RAG thường gửi các đoạn dư thừa hoặc không liên quan mạnh. Nén có thể loại bỏ trùng lặp, lọc và trích xuất các đoạn văn trả lời câu hỏi hiện tại.
Bộ nhớ đệm lời nhắc có phải là sự thay thế cho nén không?
Không. Bộ nhớ đệm lời nhắc có thể giúp với các tiền tố lặp lại trong các hệ thống được hỗ trợ, nhưng nén vẫn quan trọng khi ngữ cảnh bị nhiễu, lỗi thời, trùng lặp hoặc quá lớn cho nhiệm vụ.
Những nhóm nào hưởng lợi nhiều nhất từ việc nén token?
Các nhóm có lịch sử trò chuyện dài, tác nhân sử dụng nhiều công cụ, quy trình làm việc tài liệu, tự động hóa hỗ trợ, trợ lý nghiên cứu và hệ thống RAG thường thấy nhu cầu rõ ràng nhất về nén.
Làm thế nào tôi nên bắt đầu kiểm tra nén?
Chọn một quy trình làm việc tốn kém, thu thập các yêu cầu đại diện, tạo các phiên bản nén, và so sánh việc sử dụng token, chất lượng câu trả lời, độ trễ, và chi phí cho mỗi nhiệm vụ thành công.
Nén hoạt động như thế nào với định tuyến AI?
Nén chuẩn bị một yêu cầu sạch hơn. Định tuyến quyết định mô hình hoặc tuyến nhà cung cấp tốt nhất cho yêu cầu đó dựa trên giá cả, độ trễ, khả năng sẵn có, độ tin cậy, và nhu cầu chất lượng.
Bước tiếp theo
Bắt đầu với một quy trình làm việc nơi sự phình to ngữ cảnh có thể thấy rõ. Nén các phần nhiễu, giữ lại bằng chứng quan trọng, sau đó sử dụng ShareAI để so sánh các tuyến mô hình thông qua một API. Mục tiêu thực tế rất đơn giản: ít token bị lãng phí hơn, ít leo thang không cần thiết hơn, và dữ liệu sử dụng rõ ràng hơn.