moins au LLMEnvoyer le contexte.
Aether Compress optimise votre contexte avant l'appel du modèle. Il réduit la charge de tokens d'entrée inutiles, conserve les informations disponibles et rend votre flux AI actuel plus efficace.
travailler avant le modèleune couche d'optimisation du contexte.
Lors d'un appel LLM, le modèle pose non seulement la question, mais aussi Il traite tout le contexte que vous envoyez. ce contexte À mesure qu'elle grandit, la quantité de jetons d'entrée augmente également.
Aether Compress, se place entre votre application et le modèle. Il optimise d'abord le contexte et produit un contexte plus petit. L'étape suivante est entièrement sous votre contrôle.
Une partie du coût du modèleCela provient de la charge utile que vous envoyez au modèle.
Un plus grand contexte signifie toujours des informations plus utiles. Ça ne vient pas. Répétitions, contenu auxiliaire et faible pertinence par rapport à la requête Les sections sont également transférées au modèle en tant que jetons d'entrée.
À mesure que le contexte d'entrée s'agrandit, la quantité de jetons envoyés et facturés au fournisseur augmente.
Le contenu inutile consomme un espace contextuel que des informations réellement nécessaires pourraient utiliser.
Ce qui peut sembler être une petite différence dans une seule demande se transforme en un total important de jetons avec un volume d'appels élevé.
Le contexte entre.Un contexte optimisé apparaît.
Aether Compress ne tente pas de générer une réponse du modèle. Sa tâche est de rendre le contexte d'entrée plus efficace avant d'atteindre le LLM.
Vous envoyez le contexte existant dans votre application à l'API Aether.
S'il n'y a pas de requête, l'optimisation générale est appliquée, et s'il y a une requête, l'optimisation orientée requête est appliquée.
Aether identifie la charge pouvant être réduite tout en conservant les informations utilisables.
Le contexte optimisé revient directement à votre application.
Requête ou pas.
Il existe deux manières différentes d'utiliser le contexte. Vous pouvez utiliser le format d'optimisation.
Contexte généralOptimiser et protéger.
contexte sans question spécifique de l'utilisateur Mode général lorsque vous souhaitez optimiser vous pouvez utiliser
Context'iConcentrez-vous sur la requête.
Si la question de l'utilisateur est connue, la requête peut également être ajoutée à la demande d'optimisation. Ainsi, Aether traite le contexte en tenant compte des besoins en informations de cette requête.
Un autre modèleeklemiyoruz.
Faire un nouvel appel LLM pour réduire le coût du contexte peut signifier déplacer le coût ailleurs. Aether Compress ne base pas son opération d'optimisation sur un appel LLM séparé.
Aether Compress n'envoie pas de requête à un autre modèle d'intelligence artificielle pour optimiser le contexte.
Le contexte optimisé peut être utilisé à l'étape suivante avec le modèle ou le fournisseur que vous préférez.
Vous n'avez pas besoin de modifier votre modèle, votre architecture d'invite ou la couche LLM principale de votre application.
Vous pouvez mesurer le résultat en comparant la quantité de jetons originaux et optimisés dans chaque requête.
Obtenez simplement le contexte.Continuez jusqu'à la réponse si vous le souhaitez.
Aether Compress est la couche d'optimisation du produit. Aether Generate est l'utilisation facultative qui combine cette couche en un seul appel avec votre fournisseur d'IA.
Le contexte optimisé revient directement à votre application. Vous décidez quel modèle, quand et comment l'utiliser. Vous déterminez.
Le contexte est d'abord optimisé, puis son propre fournisseur est envoyé au modèle via votre compte et la réponse finale tourne en un seul flux.
Avec un seul appel APIajoutez-le à votre flux.
Il suffit d'ajouter Aether Compress entre votre étape actuelle de création de contexte et votre appel LLM.
Examiner la documentationconst response = await fetch(
"https://api.aether.tr/v1/compress",
{
method: "POST",
headers: {
"Authorization": "Bearer YOUR_API_KEY",
"Idempotency-Key": crypto.randomUUID(),
"Content-Type": "application/json"
},
body: JSON.stringify({
context,
query
})
}
);
const result = await response.json();
console.log(result.context);Si le contexte s'agrandit,Cela pourrait être un domaine d’optimisation.
Aether se concentre sur la structure du contexte envoyée au LLM plutôt que sur un secteur spécifique.
Optimisez les longs historiques de conversations et les contextes répétitifs avant l'appel du modèle.
Rendre les fragments de documents résultant de la récupération plus efficaces en fonction de la requête de l'utilisateur.
Réduisez le fardeau des résultats des outils, de l’historique des tâches et du contexte d’agent accumulé.
N’emportez pas de longs rapports, contrats et documents d’entreprise dans leur intégralité avec chaque demande.
Optimisez l’historique des conversations, les informations client et le contexte du centre d’aide.
Réduisez les contextes volumineux contenant du code source, des journaux, des sorties d’erreurs et de la documentation technique.
Pas seulement plus petit.Les informations doivent également être protégées.
Lorsque nous évaluons Aether Compress, nous ne mesurons pas seulement la réduction des tokens. Nous vérifions également séparément que le contexte optimisé conserve les informations nécessaires.
Consultez les résultats du benchmarkS'il n'y a pas de réduction sûreIl n'est pas nécessaire de réduire.
L’objectif n’est pas de produire une production moindre en toutes circonstances. Plus important que de réduire le contexte qui doit être préservé, protection des informations utilisables.
Pas la moyenne marketing,Regardez votre propre contexte.
La structure du contexte diffère pour chaque application. La meilleure façon de voir la valeur réelle de Aether est de la mesurer sur vos propres entrées de production.
Si le coût du contexte existe réellement.
Si vos demandes contiennent un historique de conversation, des documents ou un contexte système important.
Dans les systèmes où la même optimisation est répétée sur des milliers ou des millions de requêtes.
Si l'entrée se fait déjà au niveau de quelques tokens, l'espace pouvant être réduit est naturellement limité.
Si votre contexte a été minimisé de manière agressive auparavant, le gain supplémentaire peut être inférieur.
Soumettez votre contexte.Voyez la différence dans vos propres données.
Testez Aether Compress avec 1 million de tokens gratuits sur de vraies entrées ressemblant à votre contexte de production.
