Glossaire FintechIA & LLM

Compression de Contexte

La compression de contexte est une technique dans les systemes RAG qui reduit la quantite de contexte recupere transmis au LLM tout en preservant les informations les plus pertinentes. L'objectif est d'adapter le contenu le plus utile dans la fenetre de contexte du LLM, de reduire les couts de traitement et d'ameliorer la qualite des reponses en eliminant les informations non pertinentes ou redondantes. Sans compression, les systemes RAG recuperent typiquement plus de chunks que ne peut en contenir la fenetre de contexte, ou ils incluent des chunks contenant des informations non pertinentes a cote des parties pertinentes. La compression de contexte aborde cela par plusieurs approches : la compression extractive qui selectionne les phrases ou passages les plus pertinents des chunks recuperes, la compression abstractive qui utilise un LLM pour resumer le contenu recupere, le filtrage qui supprime les chunks en dessous d'un seuil de pertinence, et le reclassement qui reordonne les chunks par pertinence et selectionne uniquement les top-k. L'approche la plus courante est le reclassement, un modele specialise qui note chaque chunk recupere pour sa pertinence par rapport a la requete et selectionne le sous-ensemble le plus pertinent. Les reclasseurs sont plus precis que la similarite vectorielle initiale car ils utilisent des architectures de codeur croise qui encodent conjointement la requete et chaque chunk, capturant des signaux de pertinence fins que les embeddings bi-encodeurs peuvent manquer. Les techniques de compression plus avancees incluent la compression basee sur LLM ou le LLM genere un resume compresse du contexte recupere, la compression basee sur instructions ou le systeme invite le LLM a se concentrer sur des aspects specifiques du contenu recupere, et la compression structuree qui extrait et organise les informations dans un format predefini comme des tableaux ou des points de balle. La compression de contexte est particulierement importante pour les requetes complexes necessitant la synthese d'informations provenant de plusieurs documents, ou le contenu recupere total peut largement depasser la fenetre de contexte disponible. Le taux de compression est un parametre de conception cle, une compression trop agressive peut perdre des informations importantes, tandis qu'une compression trop faible peut ne pas apporter suffisamment d'avantages.

Dans les services financiers

Dans les services financiers, la compression de contexte est critique pour plusieurs raisons. Les documents financiers sont typiquement longs et denses, un seul depot 10-K peut contenir des centaines de pages avec des milliers de passages pertinents. Lorsqu'un systeme RAG recupere des chunks de plusieurs documents financiers, le contenu total peut rapidement depasser la fenetre de contexte du LLM, surtout pour les requetes complexes necessitant la synthese d'informations provenant de multiples sources. La compression de contexte garantit que les informations financieres les plus pertinentes sont presentees au LLM, ameliorant a la fois la qualite et la precision de la reponse generee. Les requetes financieres necessitent souvent des informations numeriques precises provenant de sections specifiques de documents. Par exemple, une requete sur la 'croissance des revenus au dernier trimestre' doit extraire des chiffres specifiques de la section des etats financiers d'un depot, pas de la discussion generale dans le commentaire de gestion. Les techniques de compression de contexte comme le reclassement peuvent prioriser les chunks de la section des etats financiers par rapport aux sections moins pertinentes. Les implications de cout de la compression de contexte sont egalement significatives dans les services financiers, ou les couts LLM augmentent avec le nombre de tokens d'entree. Comprimer le contexte de 50 a 80 % peut reduire les couts d'inference de la meme proportion tout en maintenant ou en ameliorant la qualite des reponses. Pour les institutions financieres traitant des millions de requetes par mois, les economies de couts provenant de la compression de contexte peuvent etre substantielles. La compression de contexte soutient egalement les exigences de conformite en garantissant que le LLM ne considere que les sources les plus pertinentes et autorisees lors de la generation de reponses. En filtrant les chunks moins pertinents ou de moindre qualite, la compression reduit le risque que le LLM incorpore des informations provenant de sources non fiables.

Exemple concret

Une grande banque d'investissement implemente la compression de contexte dans son systeme RAG pour l'analyse des resultats. Pour une requete sur 'la repartition des revenus d'Apple au T3 2026 par segment,' le systeme recupere 50 chunks provenant de 15 documents differents, y compris le communique de resultats, le depot 10-Q, les rapports d'analystes et les articles de presse. Le reclasseur note chaque chunk et selectionne les 15 plus pertinents, comprimant le contexte de 35 000 tokens a 8 000 tokens. Le LLM genere ensuite une reponse basee sur le contexte compresse, incluant les chiffres de revenus pour les segments iPhone, Services, Mac, iPad et Wearables. Le systeme signale que la compression de contexte a ameliore la precision des reponses de 15 % sur un referentiel de 500 requetes financieres, tout en reduisant les couts par requete de 60 %. La banque constate egalement que les scores de pertinence du reclasseur fournissent un signal de confiance utile, lorsque les chunks les mieux classes ont de faibles scores de pertinence, le systeme peut signaler la reponse pour examen humain.

Pourquoi c'est important en Finance

La compression de contexte est une optimisation critique pour les systemes RAG financiers car elle aborde directement la tension entre la quantite de recuperation et la qualite de generation. Recuperer plus de documents ameliore le rappel mais peut submerger la fenetre de contexte du LLM et introduire du bruit. La compression de contexte resout cette tension en permettant au systeme de recuperer largement tout en ne presentant que les informations les plus pertinentes au LLM. Pour les institutions financieres, ou les volumes de documents sont importants et les requetes complexes, la compression est essentielle pour construire des systemes RAG a la fois precis et rentables. La technique fournit egalement un signal de confiance naturel via les scores de reclassement, qui peuvent etre utilises pour la surveillance de la qualite et les flux de travail d'escalade.

Termes associés

Fenêtre de ContexteGénération Augmentée par Récupération (RAG)Chunking (RAG)Pipeline RAGTokens (IA)

Explorer dans Finatune

LangChainLlamaIndex

Questions fréquentes

Qu'est-ce que la compression de contexte en RAG ?

La compression de contexte reduit la quantite de contexte recupere transmis au LLM tout en preservant les informations les plus pertinentes via le reclassement, le filtrage et la synthese.

Comment la compression de contexte aide-t-elle avec les grands documents financiers ?

Elle aide en filtrant et priorisant les passages les plus pertinents des grands documents financiers, reduisant l'utilisation de tokens et ameliorant la qualite des reponses.

Quand utiliser la compression de contexte pour le RAG documentaire financier ?

Utilisez-la lorsque les requetes necessitent la synthese d'informations provenant de plusieurs documents financiers ou que les chunks recuperes depassent la fenetre de contexte.

Terme précédent: Comportement Emergent
Terme suivant: Debit IA
Voir tous les termes Fintech