AETHER · Aether Compress

moins au LLMEnvoyer le contexte.

Aether Compress optimise votre contexte avant l'appel du modèle. Il réduit la charge de tokens d'entrée inutiles, conserve les informations disponibles et rend votre flux AI actuel plus efficace.

Aucune carte de crédit requise
1 million de jetons gratuits
Aether Compress
Optimisation du contexte
Ready
Contexte d'entrée12 840 jetons
Optimize
Contexte optimisé7 620 jetons
-40,65%
ortalama
3,48 ms
moyenne mesurée.
100%
résultat du test
Pas d'appel LLM·Aucun GPU requis·Contexte d'entrée/contexte de sortie
40,65%
réduction moyenne des intrants
100K+
scénario de vérification
100%
précision de la réponse mesurée
3,48 ms
délai de traitement moyen
Qu'est-ce que Aether Compress ?

travailler avant le modèleune couche d'optimisation du contexte.

Lors d'un appel LLM, le modèle pose non seulement la question, mais aussi Il traite tout le contexte que vous envoyez. ce contexte À mesure qu'elle grandit, la quantité de jetons d'entrée augmente également.

Aether Compress, se place entre votre application et le modèle. Il optimise d'abord le contexte et produit un contexte plus petit. L'étape suivante est entièrement sous votre contrôle.

règlement
01
Votre candidature
Le contexte se produit
02
Aether Compress
Le contexte est optimisé
03
Votre flux LLM actuel
Un contexte optimisé est utilisé
changerContext
immuableVotre architecture modèle
Économie de contexte

Une partie du coût du modèleCela provient de la charge utile que vous envoyez au modèle.

Un plus grand contexte signifie toujours des informations plus utiles. Ça ne vient pas. Répétitions, contenu auxiliaire et faible pertinence par rapport à la requête Les sections sont également transférées au modèle en tant que jetons d'entrée.

01
Coût du jeton

À mesure que le contexte d'entrée s'agrandit, la quantité de jetons envoyés et facturés au fournisseur augmente.

02
Zone contextuelle

Le contenu inutile consomme un espace contextuel que des informations réellement nécessaires pourraient utiliser.

03
échelle

Ce qui peut sembler être une petite différence dans une seule demande se transforme en un total important de jetons avec un volume d'appels élevé.

Comment ça marche ?

Le contexte entre.Un contexte optimisé apparaît.

Aether Compress ne tente pas de générer une réponse du modèle. Sa tâche est de rendre le contexte d'entrée plus efficace avant d'atteindre le LLM.

01
Envoyer le contexte

Vous envoyez le contexte existant dans votre application à l'API Aether.

02
Le mode est déterminé

S'il n'y a pas de requête, l'optimisation générale est appliquée, et s'il y a une requête, l'optimisation orientée requête est appliquée.

03
Le contexte est optimisé

Aether identifie la charge pouvant être réduite tout en conservant les informations utilisables.

04
Obtenez le résultat

Le contexte optimisé revient directement à votre application.

Modes d'optimisation

Requête ou pas.

Il existe deux manières différentes d'utiliser le contexte. Vous pouvez utiliser le format d'optimisation.

mode 01
General

Contexte généralOptimiser et protéger.

contexte sans question spécifique de l'utilisateur Mode général lorsque vous souhaitez optimiser vous pouvez utiliser

Mémoire de conversationÉtat de l'agentContexte général
Mode 02
Query-Aware

Context'iConcentrez-vous sur la requête.

Si la question de l'utilisateur est connue, la requête peut également être ajoutée à la demande d'optimisation. Ainsi, Aether traite le contexte en tenant compte des besoins en informations de cette requête.

RAGQuestions et réponses sur les documentsService client
Quelle est la différence ?

Un autre modèleeklemiyoruz.

Faire un nouvel appel LLM pour réduire le coût du contexte peut signifier déplacer le coût ailleurs. Aether Compress ne base pas son opération d'optimisation sur un appel LLM séparé.

Optimisation sans LLM

Aether Compress n'envoie pas de requête à un autre modèle d'intelligence artificielle pour optimiser le contexte.

Indépendant du fournisseur

Le contexte optimisé peut être utilisé à l'étape suivante avec le modèle ou le fournisseur que vous préférez.

En avance sur le flux actuel

Vous n'avez pas besoin de modifier votre modèle, votre architecture d'invite ou la couche LLM principale de votre application.

Résultat mesurable

Vous pouvez mesurer le résultat en comparant la quantité de jetons originaux et optimisés dans chaque requête.

Flux API

Obtenez simplement le contexte.Continuez jusqu'à la réponse si vous le souhaitez.

Aether Compress est la couche d'optimisation du produit. Aether Generate est l'utilisation facultative qui combine cette couche en un seul appel avec votre fournisseur d'IA.

Aether Compress
Optimiser uniquement
Pas d'appel IA
INPUTcontext
AETHERcompress
OUTPUTdata.compressed

Le contexte optimisé revient directement à votre application. Vous décidez quel modèle, quand et comment l'utiliser. Vous déterminez.

Aether Generate
Optimiser + Générer
BYOK
INPUTcontext
AETHERcompress
PROVIDERyour_llm
OUTPUTresponse

Le contexte est d'abord optimisé, puis son propre fournisseur est envoyé au modèle via votre compte et la réponse finale tourne en un seul flux.

Entegrasyon

Avec un seul appel APIajoutez-le à votre flux.

Il suffit d'ajouter Aether Compress entre votre étape actuelle de création de contexte et votre appel LLM.

Examiner la documentation
POST /v1/compress
const response = await fetch(
  "https://api.aether.tr/v1/compress",
  {
    method: "POST",
    headers: {
      "Authorization": "Bearer YOUR_API_KEY",
      "Idempotency-Key": crypto.randomUUID(),
      "Content-Type": "application/json"
    },
    body: JSON.stringify({
      context,
      query
    })
  }
);

const result = await response.json();

console.log(result.context);
Before12,840
After7,620
Domaines d'utilisation

Si le contexte s'agrandit,Cela pourrait être un domaine d’optimisation.

Aether se concentre sur la structure du contexte envoyée au LLM plutôt que sur un secteur spécifique.

Assistants IA

Optimisez les longs historiques de conversations et les contextes répétitifs avant l'appel du modèle.

Systèmes RAG

Rendre les fragments de documents résultant de la récupération plus efficaces en fonction de la requête de l'utilisateur.

Agent IA

Réduisez le fardeau des résultats des outils, de l’historique des tâches et du contexte d’agent accumulé.

Analyse de documents

N’emportez pas de longs rapports, contrats et documents d’entreprise dans leur intégralité avec chaque demande.

Service client

Optimisez l’historique des conversations, les informations client et le contexte du centre d’aide.

Code et contenu technique

Réduisez les contextes volumineux contenant du code source, des journaux, des sorties d’erreurs et de la documentation technique.

vérification

Pas seulement plus petit.Les informations doivent également être protégées.

Lorsque nous évaluons Aether Compress, nous ne mesurons pas seulement la réduction des tokens. Nous vérifions également séparément que le contexte optimisé conserve les informations nécessaires.

Consultez les résultats du benchmark
100.000
scénario d'authentification locale
40,65%
réduction moyenne des intrants
500 / 500
vérification de modèle externe
52,67%
réduction maximale mesurée
Remarque sur les mesures : La valeur de 40,65 % est la moyenne d'un ensemble de validation de 100 000 scénarios. C’est une réduction des intrants. Le résultat réel varie en fonction de la structure du contexte. La valeur de 3,48 ms est le temps de traitement moyen mesuré dans l'environnement de validation.
Vous avez le contrôle

S'il n'y a pas de réduction sûreIl n'est pas nécessaire de réduire.

L’objectif n’est pas de produire une production moindre en toutes circonstances. Plus important que de réduire le contexte qui doit être préservé, protection des informations utilisables.

Mesurer

Pas la moyenne marketing,Regardez votre propre contexte.

La structure du contexte diffère pour chaque application. La meilleure façon de voir la valeur réelle de Aether est de la mesurer sur vos propres entrées de production.

Quand est-ce que cela a du sens ?

Si le coût du contexte existe réellement.

Contexte long

Si vos demandes contiennent un historique de conversation, des documents ou un contexte système important.

Volume d'appels élevé

Dans les systèmes où la même optimisation est répétée sur des milliers ou des millions de requêtes.

Invite très courte

Si l'entrée se fait déjà au niveau de quelques tokens, l'espace pouvant être réduit est naturellement limité.

Contexte déjà minime

Si votre contexte a été minimisé de manière agressive auparavant, le gain supplémentaire peut être inférieur.

Aether Compress

Soumettez votre contexte.Voyez la différence dans vos propres données.

Testez Aether Compress avec 1 million de tokens gratuits sur de vraies entrées ressemblant à votre contexte de production.

Aucune carte de crédit requise
1 million de jetons gratuits