Longueur de Contexte
La longueur de contexte, également appelée fenêtre de contexte, est le nombre maximum de jetons qu'un grand modèle de langage peut traiter en une seule entrée, déterminant la quantité de texte que le modèle peut considérer simultanément lors de la génération d'une réponse. La longueur de contexte est un paramètre architectural fondamental des modèles de langage basés sur les transformers, contrainte par le mécanisme d'attention du modèle qui doit calculer les relations entre chaque paire de jetons dans l'entrée. Les longueurs de contexte plus longues nécessitent plus de ressources de calcul, plus de mémoire et des implémentations d'attention plus sophistiquées telles que l'attention sparse, l'attention à fenêtre glissante ou l'attention flash pour maintenir des performances acceptables. La longueur de contexte des modèles d'IA a considérablement augmenté ces dernières années, passant des 2 048 jetons du GPT-3 original aux 200 000 jetons de Claude 3, au million de jetons de Gemini 1.5 Pro et aux 4 millions de jetons de MiniMax. Cette expansion a fondamentalement changé les capacités des systèmes d'IA, leur permettant de traiter des livres entiers, des rapports financiers complets, des historiques de conversation étendus et de grandes bases de code en un seul passage. L'importance de la longueur de contexte s'étend au-delà de la taille d'entrée maximale car la capacité du modèle à utiliser efficacement la fenêtre de contexte complète, souvent appelée utilisation effective du contexte, varie significativement selon les modèles et les tâches. Certains modèles maintiennent des performances constantes sur toute leur fenêtre de contexte, tandis que d'autres présentent une dégradation au milieu ou à la fin des contextes longs, un phénomène connu sous le nom de problème perdu-au-milieu. Les implications pratiques de la longueur de contexte pour les applications incluent la capacité de traiter des documents plus longs sans découpage, de maintenir des historiques de conversation plus longs, d'incorporer plus de documents récupérés dans les systèmes de génération augmentée de récupération et de gérer des interactions multi-tours complexes.
Dans les services financiers
Exemple concret
Le département de recherche d'une banque d'investissement européenne traite en moyenne 200 dépôts d'entreprises par jour pendant la saison des résultats, chacun faisant en moyenne 150 à 400 pages. La banque utilisait traditionnellement un modèle avec une fenêtre de contexte de 32 000 jetons, obligeant à découper les documents en segments d'environ 20 pages chacun. Les analystes soumettaient des requêtes contre des segments individuels, et les résultats devaient être combinés et reconciliés manuellement pour répondre à des questions nécessitant des références croisées entre différentes sections du document. La banque passe à un modèle avec une fenêtre de contexte de 200 000 jetons, qui peut traiter le dépôt 10-K complet d'une grande entreprise pharmaceutique européenne en un seul passage. Le dépôt 10-K fait 280 pages, contenant environ 180 000 jetons de texte incluant la description de l'entreprise, les facteurs de risque, la discussion de la direction, les états financiers et les notes de bas de page. Un analyste demande au modèle: 'Sur la base du dépôt complet, identifiez toute incohérence entre les politiques de reconnaissance des revenus décrites dans les notes de bas de page et les tendances réelles des revenus rapportées dans la discussion de la direction, et évaluez si la concentration du risque de revenu de l'entreprise est adéquatement divulguée dans toutes les sections pertinentes.' Le modèle traite l'ensemble du document en une seule fenêtre de contexte, référencant les informations entre les sections, et identifie que la politique de reconnaissance des revenus de l'entreprise pour les contrats à long terme, décrite dans la note 2, a été appliquée différemment à un contrat spécifique qui est discuté dans la section de discussion de la direction mais pas dans les facteurs de risque. Le modèle identifie également que le risque de concentration des clients, bien que mentionné dans les facteurs de risque, n'est pas adéquatement reflété dans la section de reporting par segment. L'analyste reçoit une analyse complète et transversale qui aurait nécessité l'examen de 14 segments de documents distincts avec le modèle précédent, et le temps d'analyse total diminue de 3 heures à 15 minutes.
Pourquoi c'est important en Finance
La longueur de contexte est l'une des spécifications techniques les plus importantes pour les applications d'IA financière car elle détermine directement les types de documents et de flux de travail qui peuvent être traités sans découpage, troncature ou perte de contexte cross-référentiel. Les documents financiers sont parmi les plus longs et les plus complexes de toutes les industries, avec des dépôts réglementaires, des contrats juridiques, des rapports de due diligence et des analyses de recherche dépassant couramment les fenêtres de contexte des modèles plus petits. La capacité de traiter ces documents dans leur intégralité n'est pas une commodité mais une nécessité pour de nombreux cas d'utilisation financière, car les relations entre les différentes sections d'un document financier sont souvent essentielles à l'analyse. Par exemple, comprendre si les facteurs de risque divulgués dans un prospectus sont cohérents avec les projections financières nécessite de référencer des informations dans tout le document, ce qui n'est possible qu'avec une fenêtre de contexte suffisamment longue. L'expansion des longueurs de contexte ces dernières années a ouvert de nouvelles capacités pour l'IA financière qui étaient auparavant impossibles. Les modèles avec des fenêtres de contexte d'un million de jetons peuvent traiter des cadres réglementaires entiers, des bibliothèques juridiques complètes ou des salles de données de due diligence exhaustives en un seul passage, permettant à l'IA d'effectuer une analyse holistique qui n'était auparavant possible que par un examen humain. Cette capacité a le potentiel de transformer l'économie de l'analyse financière, réduisant le temps et le coût des flux de travail intensifs en documents par des ordres de grandeur. Cependant, les institutions financières doivent également être conscientes des limites des longues fenêtres de contexte. Tous les modèles ne maintiennent pas des performances constantes sur toute leur longueur de contexte, et le coût et la latence du traitement de contextes très longs peuvent être substantiels. L'utilisation effective du contexte, qui mesure comment le modèle utilise réellement les informations dans sa fenêtre de contexte, est souvent plus importante que la longueur de contexte brute. Les institutions financières devraient donc évaluer les modèles sur des cas d'utilisation financière réalistes, testant la capacité du modèle à trouver et synthétiser des informations à travers de longs documents, plutôt que de se fier uniquement aux spécifications de longueur de contexte annoncées.
Termes associés
Explorer dans Finatune
Questions fréquentes
Qu'est-ce que la longueur de contexte dans les modèles d'IA?
La longueur de contexte est le nombre maximum de jetons qu'un modèle d'IA peut traiter en une seule entrée. Elle détermine la quantité de texte que le modèle peut considérer à la fois, allant de quelques milliers de jetons dans les premiers modèles à 4 millions dans les modèles les plus récents.
Comment la longueur de contexte affecte-t-elle le traitement des documents financiers?
Une longueur de contexte plus longue permet à l'IA de traiter des documents financiers complets sans découpage. Cela est essentiel pour les questions qui nécessitent des références croisées entre différentes sections d'un document, comme la vérification de la cohérence entre les risques divulgués et les états financiers.
Quel modèle d'IA a la plus longue fenêtre de contexte pour les documents financiers?
MiniMax offre la plus longue fenêtre de contexte à 4 millions de jetons, suivi de Google Gemini à 1 million de jetons et Claude à 200 000 jetons. L'utilisation effective du contexte est souvent plus importante que le maximum brut.