AETHER · Cas d'utilisation

Le contexte grandit.La charge n'a pas besoin d'augmenter.

Des assistants IA aux systèmes RAG, des flux de travail des agents à l'analyse de documents, Aether Compress, peut être adapté à différents scénarios d'utilisation où vous pouvez réduire la charge d'entrée inutile envoyée au LLM.

Problème courant

Les applications sont différentes.Le problème de contexte est le même.

À mesure que les applications d’IA se développent, les informations envoyées au modèle évoluent également. grandit. Historiques de conversations, résultats de récupération, outil sorties, documentation et instructions système à chaque nouvelle demande. Cela fait partie du coût des intrants.

Aether crée une couche séparée où cette charge peut être optimisée avant d'atteindre le LLM.

Pipeline de contexte
01
Uygulama
Le contexte se produit
02
Aether Compress
La saisie est optimisée
03
LLM
Un contexte plus petit est envoyé
Entegrasyonen avance sur le flux actuel
Où est-il utilisé ?

Partout qui utilise le contexteIl y a peut-être place à l’optimisation.

Le domaine d'utilisation est plus que le secteur, c'est l'entrée envoyée à LLM. Il s'agit de la structure.

01 · Assistants IA
Compresser + Générer

Portez les longues conversations plus légères.

À mesure que les assistants IA se développent, l’historique des conversations, les instructions système et le contexte supplémentaire peuvent être transférés à chaque requête. Aether Compress aide à réduire la charge d'entrée en optimisant le contexte à envoyer au modèle.

Longs historiques de conversationsContexte système et utilisateurInformations de session en double
02 · Systèmes RAG
Orienté requête

Vous n'êtes pas obligé de déplacer l'intégralité du contexte récupéré.

La couche de récupération peut retourner de nombreux fragments de documents pour une requête. Aether aide à créer une entrée plus compacte en optimisant le contexte récupéré avant l’appel du LLM.

Morceaux récupérésbases de connaissancesQuestions et réponses basées sur des documents
03 · Service client
Compresser + Générer

Ne soumettez pas à nouveau le même chargement pour chaque demande d'assistance.

Les bots de support peuvent transporter l'historique client, la documentation produit, les messages précédents et les règles de support dans la même requête. Aether permet d'optimiser ce contexte avant le LLM.

Discours de soutienhistorique clientContenu du centre d'aide
04 · Agent IA
Compress

À mesure que l’agent grandit, le contexte n’a pas besoin de croître également.

Dans les systèmes d'agents, les résultats des outils, l'historique des tâches et les étapes intermédiaires peuvent s'accumuler rapidement dans le contexte. Aether peut être utilisé pour réduire la charge d'entrée transportée avant l'appel modèle suivant.

Sorties de l'outilHistorique des tâchesFlux de travail en plusieurs étapes
05 · Code et contenu technique
Compress

Envoyez plus efficacement un contexte technique volumineux.

Les assistants de code et les outils d'IA techniques peuvent transporter le code source, les journaux d'erreurs, les configurations et la documentation dans le même contexte. Aether peut optimiser cette entrée avant l'appel au modèle.

Contexte du code sourceSorties de journaux et d'erreursDocumentation technique
06 · Analyse de documents
Orienté requête

Ne retirez pas les longs documents pour chaque question.

Dans les applications d'IA travaillant sur des rapports, des contrats, des manuels et des documents d'entreprise, le contexte requis peut être optimisé en fonction de la requête et des entrées plus petites peuvent être envoyées au modèle.

Rapports et contratsDocuments d'entrepriseAnalyse de texte long
Deux approches d'optimisation

Selon le contexte.Selon la requête.

Optimisation générale
sans requêteoptimisation du contexte.

Optimiser le contenu sans le lier à une question spécifique Il peut être utilisé dans les flux que vous souhaitez. historiques de conversations, Les systèmes qui transportent l’état de l’agent ou le contexte général en sont des exemples.

Assistant IAAgentContexte technique
Orienté requête
Si la question est connueUtilisez également la concentration.

Si la requête de l'utilisateur est connue à l'avance, Aether peut inclure la requête dans le processus d'optimisation, traitant le contexte de manière ciblée sur cette demande.

RAGQuestions et réponses sur les documentsDestek
Exemple · RAG

Quand la récupération est terminéel’optimisation peut commencer.

Aether ne remplace pas le système de récupération. Elle est ajoutée entre le résultat de la récupération et l'appel au LLM.

01
Requête de l'utilisateur

Votre application répond à la question.

02
Retrieval

Votre infrastructure RAG existante récupère les fragments de documents pertinents.

03
Aether Compress

Le contexte récupéré est optimisé en tenant compte de la requête de l'utilisateur.

04
LLM

Le contexte optimisé est envoyé à votre fournisseur de modèles actuel.

Volume élevé
petites économiesgrandit en volume.

La différence de jetons dans une seule requête peut sembler minime. Même optimisation dans des milliers ou des millions d'appels LLM Lorsqu'elle est répétée, la différence dans le volume total d'entrée augmente.

Architecture actuelle
ModeliniziVous n'êtes pas obligé de le changer.

Aether n'est pas une sélection de modèle. Étant donné qu'il fonctionne lors de la préparation du contexte, il peut être ajouté avant le flux AI existant.

Indépendant du secteur

Si le problème vient des jetons,Le secteur est en retrait.

Aether n'est pas une couche d'optimisation conçue selon la terminologie d'un secteur spécifique. Par conséquent, la même architecture peut être utilisée dans différentes applications AI.

SaaS

Produits logiciels qui utilisent des fonctionnalités d’IA.

E-ticaret

Assistants produits, support et achats.

Finans

Applications d'IA basées sur les documents et les connaissances.

Hukuk

Analyse de documents longs et de contrats.

Kurumsal

Bases de connaissances internes et assistants des employés.

Outils de développement

Applications qui utilisent du code, des journaux et un contexte technique.

Deux modes d'utilisation

Obtenez le contexte.Ou obtenez la réponse.

Option 01
Aether Compress
Optimiser uniquement

Le contexte optimisé revient directement à votre application. Votre infrastructure existante effectue elle-même le prochain appel LLM.

POST /v1/compress
Option 02
Aether Generate
Flux unique

Le contexte est d'abord optimisé avec Aether Compress, puis envoyé au fournisseur AI que vous avez choisi et la réponse finale retourne à votre application.

Compresser → Fournisseur → Réponse
Utilisation correcte

Toutes les demandes ne doivent pas nécessairement être compressées.

Entrées très courtes

Si le contexte est déjà très petit, la surcharge à optimiser peut être limitée.

Faible volume de répétition

L’impact économique total peut naturellement être inférieur pour les applications qui nécessitent très peu de LLM.

C'est déjà un contexte minimal

Si la saisie a déjà été fortement optimisée, les possibilités de réductions supplémentaires peuvent être limitées.

Mesurez d'abord

La décision la plus précise est obtenue en testant Aether avec vos propres entrées réelles.

Votre propre scénario

Meilleur cas d'utilisationvos vraies données.

Essayez Aether Compress dans votre propre contexte et mesurez combien d'espace il occupe dans votre charge d'entrée.

Essayez-le gratuitement
Aucune carte de crédit requise
1 million de jetons gratuits