Compression de Contexte
La compression de contexte est une technique dans les systemes RAG qui reduit la quantite de contexte recupere transmis au LLM tout en preservant les informations les plus pertinentes. L'objectif est d'adapter le contenu le plus utile dans la fenetre de contexte du LLM, de reduire les couts de traitement et d'ameliorer la qualite des reponses en eliminant les informations non pertinentes ou redondantes. Sans compression, les systemes RAG recuperent typiquement plus de chunks que ne peut en contenir la fenetre de contexte, ou ils incluent des chunks contenant des informations non pertinentes a cote des parties pertinentes. La compression de contexte aborde cela par plusieurs approches : la compression extractive qui selectionne les phrases ou passages les plus pertinents des chunks recuperes, la compression abstractive qui utilise un LLM pour resumer le contenu recupere, le filtrage qui supprime les chunks en dessous d'un seuil de pertinence, et le reclassement qui reordonne les chunks par pertinence et selectionne uniquement les top-k. L'approche la plus courante est le reclassement, un modele specialise qui note chaque chunk recupere pour sa pertinence par rapport a la requete et selectionne le sous-ensemble le plus pertinent. Les reclasseurs sont plus precis que la similarite vectorielle initiale car ils utilisent des architectures de codeur croise qui encodent conjointement la requete et chaque chunk, capturant des signaux de pertinence fins que les embeddings bi-encodeurs peuvent manquer. Les techniques de compression plus avancees incluent la compression basee sur LLM ou le LLM genere un resume compresse du contexte recupere, la compression basee sur instructions ou le systeme invite le LLM a se concentrer sur des aspects specifiques du contenu recupere, et la compression structuree qui extrait et organise les informations dans un format predefini comme des tableaux ou des points de balle. La compression de contexte est particulierement importante pour les requetes complexes necessitant la synthese d'informations provenant de plusieurs documents, ou le contenu recupere total peut largement depasser la fenetre de contexte disponible. Le taux de compression est un parametre de conception cle, une compression trop agressive peut perdre des informations importantes, tandis qu'une compression trop faible peut ne pas apporter suffisamment d'avantages.
Dans les services financiers
Exemple concret
Une grande banque d'investissement implemente la compression de contexte dans son systeme RAG pour l'analyse des resultats. Pour une requete sur 'la repartition des revenus d'Apple au T3 2026 par segment,' le systeme recupere 50 chunks provenant de 15 documents differents, y compris le communique de resultats, le depot 10-Q, les rapports d'analystes et les articles de presse. Le reclasseur note chaque chunk et selectionne les 15 plus pertinents, comprimant le contexte de 35 000 tokens a 8 000 tokens. Le LLM genere ensuite une reponse basee sur le contexte compresse, incluant les chiffres de revenus pour les segments iPhone, Services, Mac, iPad et Wearables. Le systeme signale que la compression de contexte a ameliore la precision des reponses de 15 % sur un referentiel de 500 requetes financieres, tout en reduisant les couts par requete de 60 %. La banque constate egalement que les scores de pertinence du reclasseur fournissent un signal de confiance utile, lorsque les chunks les mieux classes ont de faibles scores de pertinence, le systeme peut signaler la reponse pour examen humain.
Pourquoi c'est important en Finance
La compression de contexte est une optimisation critique pour les systemes RAG financiers car elle aborde directement la tension entre la quantite de recuperation et la qualite de generation. Recuperer plus de documents ameliore le rappel mais peut submerger la fenetre de contexte du LLM et introduire du bruit. La compression de contexte resout cette tension en permettant au systeme de recuperer largement tout en ne presentant que les informations les plus pertinentes au LLM. Pour les institutions financieres, ou les volumes de documents sont importants et les requetes complexes, la compression est essentielle pour construire des systemes RAG a la fois precis et rentables. La technique fournit egalement un signal de confiance naturel via les scores de reclassement, qui peuvent etre utilises pour la surveillance de la qualite et les flux de travail d'escalade.
Termes associés
Explorer dans Finatune
Questions fréquentes
Qu'est-ce que la compression de contexte en RAG ?
La compression de contexte reduit la quantite de contexte recupere transmis au LLM tout en preservant les informations les plus pertinentes via le reclassement, le filtrage et la synthese.
Comment la compression de contexte aide-t-elle avec les grands documents financiers ?
Elle aide en filtrant et priorisant les passages les plus pertinents des grands documents financiers, reduisant l'utilisation de tokens et ameliorant la qualite des reponses.
Quand utiliser la compression de contexte pour le RAG documentaire financier ?
Utilisez-la lorsque les requetes necessitent la synthese d'informations provenant de plusieurs documents financiers ou que les chunks recuperes depassent la fenetre de contexte.