Le contexte grandit.La charge n'a pas besoin d'augmenter.
Des assistants IA aux systèmes RAG, des flux de travail des agents à l'analyse de documents, Aether Compress, peut être adapté à différents scénarios d'utilisation où vous pouvez réduire la charge d'entrée inutile envoyée au LLM.
Les applications sont différentes.Le problème de contexte est le même.
À mesure que les applications d’IA se développent, les informations envoyées au modèle évoluent également. grandit. Historiques de conversations, résultats de récupération, outil sorties, documentation et instructions système à chaque nouvelle demande. Cela fait partie du coût des intrants.
Aether crée une couche séparée où cette charge peut être optimisée avant d'atteindre le LLM.
Partout qui utilise le contexteIl y a peut-être place à l’optimisation.
Le domaine d'utilisation est plus que le secteur, c'est l'entrée envoyée à LLM. Il s'agit de la structure.
Portez les longues conversations plus légères.
À mesure que les assistants IA se développent, l’historique des conversations, les instructions système et le contexte supplémentaire peuvent être transférés à chaque requête. Aether Compress aide à réduire la charge d'entrée en optimisant le contexte à envoyer au modèle.
Vous n'êtes pas obligé de déplacer l'intégralité du contexte récupéré.
La couche de récupération peut retourner de nombreux fragments de documents pour une requête. Aether aide à créer une entrée plus compacte en optimisant le contexte récupéré avant l’appel du LLM.
Ne soumettez pas à nouveau le même chargement pour chaque demande d'assistance.
Les bots de support peuvent transporter l'historique client, la documentation produit, les messages précédents et les règles de support dans la même requête. Aether permet d'optimiser ce contexte avant le LLM.
À mesure que l’agent grandit, le contexte n’a pas besoin de croître également.
Dans les systèmes d'agents, les résultats des outils, l'historique des tâches et les étapes intermédiaires peuvent s'accumuler rapidement dans le contexte. Aether peut être utilisé pour réduire la charge d'entrée transportée avant l'appel modèle suivant.
Envoyez plus efficacement un contexte technique volumineux.
Les assistants de code et les outils d'IA techniques peuvent transporter le code source, les journaux d'erreurs, les configurations et la documentation dans le même contexte. Aether peut optimiser cette entrée avant l'appel au modèle.
Ne retirez pas les longs documents pour chaque question.
Dans les applications d'IA travaillant sur des rapports, des contrats, des manuels et des documents d'entreprise, le contexte requis peut être optimisé en fonction de la requête et des entrées plus petites peuvent être envoyées au modèle.
Selon le contexte.Selon la requête.
Optimiser le contenu sans le lier à une question spécifique Il peut être utilisé dans les flux que vous souhaitez. historiques de conversations, Les systèmes qui transportent l’état de l’agent ou le contexte général en sont des exemples.
Si la requête de l'utilisateur est connue à l'avance, Aether peut inclure la requête dans le processus d'optimisation, traitant le contexte de manière ciblée sur cette demande.
Quand la récupération est terminéel’optimisation peut commencer.
Aether ne remplace pas le système de récupération. Elle est ajoutée entre le résultat de la récupération et l'appel au LLM.
Votre application répond à la question.
Votre infrastructure RAG existante récupère les fragments de documents pertinents.
Le contexte récupéré est optimisé en tenant compte de la requête de l'utilisateur.
Le contexte optimisé est envoyé à votre fournisseur de modèles actuel.
La différence de jetons dans une seule requête peut sembler minime. Même optimisation dans des milliers ou des millions d'appels LLM Lorsqu'elle est répétée, la différence dans le volume total d'entrée augmente.
Aether n'est pas une sélection de modèle. Étant donné qu'il fonctionne lors de la préparation du contexte, il peut être ajouté avant le flux AI existant.
Si le problème vient des jetons,Le secteur est en retrait.
Aether n'est pas une couche d'optimisation conçue selon la terminologie d'un secteur spécifique. Par conséquent, la même architecture peut être utilisée dans différentes applications AI.
Produits logiciels qui utilisent des fonctionnalités d’IA.
Assistants produits, support et achats.
Applications d'IA basées sur les documents et les connaissances.
Analyse de documents longs et de contrats.
Bases de connaissances internes et assistants des employés.
Applications qui utilisent du code, des journaux et un contexte technique.
Obtenez le contexte.Ou obtenez la réponse.
Le contexte optimisé revient directement à votre application. Votre infrastructure existante effectue elle-même le prochain appel LLM.
Le contexte est d'abord optimisé avec Aether Compress, puis envoyé au fournisseur AI que vous avez choisi et la réponse finale retourne à votre application.
Toutes les demandes ne doivent pas nécessairement être compressées.
Si le contexte est déjà très petit, la surcharge à optimiser peut être limitée.
L’impact économique total peut naturellement être inférieur pour les applications qui nécessitent très peu de LLM.
Si la saisie a déjà été fortement optimisée, les possibilités de réductions supplémentaires peuvent être limitées.
La décision la plus précise est obtenue en testant Aether avec vos propres entrées réelles.
Meilleur cas d'utilisationvos vraies données.
Essayez Aether Compress dans votre propre contexte et mesurez combien d'espace il occupe dans votre charge d'entrée.
