AETHER · Aether Compress

Invia menocontesto al LLM.

Aether Compress, ottimizza il tuo contesto prima della chiamata al modello. Riduce il carico inutile di token di input, mantiene le informazioni disponibili e permette al tuo flusso AI esistente di funzionare in modo più efficiente.

Nessuna carta di credito richiesta
1M token gratuiti
Aether Compress
Ottimizzazione del contesto
Ready
Contesto di input12.840 token
Optimize
Contesto ottimizzato7.620 token
-40,65%
ortalama
3,48 ms
media misurata
100%
risultato del test
nessuna chiamata LLM·Non richiede GPU·Contesto in / contesto out
40,65%
Riduzione media dell'input
100K+
Scenario di convalida
100%
precisione della risposta misurata
3,48 ms
Tempo medio di elaborazione
Che cos'è Aether Compress?

Funziona prima del modelloUno strato di ottimizzazione del contesto.

In una chiamata LLM, il modello elabora non solo la domanda, ma tutto il contesto che invii. Man mano che questo contesto cresce, aumenta anche la quantità di token di input.

Aether Compress si posiziona tra la tua applicazione e il modello. Ottimizza prima il contesto e produce un contesto più piccolo. Il passaggio successivo è completamente sotto il tuo controllo.

Insediamento
01
La tua applicazione
Si crea il contesto
02
Aether Compress
Il contesto viene ottimizzato
03
Il tuo flusso LLM attuale
Viene utilizzato un contesto ottimizzato
VariabileContext
CostanteArchitettura del modello
Economia del contesto

Parte del costo del modelloDeriva dal carico che invii al modello.

Un contesto più ampio non significa sempre informazioni più utili. Ripetizioni, contenuti di supporto e sezioni con bassa rilevanza rispetto alla query vengono anch'essi trasportati al modello come token di input.

01
Costo dei token

Man mano che il contesto in input cresce, aumenta anche il numero di token inviati al provider e addebitati.

02
Spazio del contesto

I contenuti non necessari consumano lo spazio del contesto che potrebbe essere utilizzato dalle informazioni veramente necessarie.

03
Scala

Una piccola differenza in una singola richiesta può trasformarsi in un grande numero totale di token con un volume elevato di chiamate.

Come funziona?

Inserisce il contesto.Ottimizza il contesto.

Aether Compress, il modello non tenta di generare una risposta. Il suo compito è rendere l'input del contesto più efficiente prima di arrivare a LLM.

01
Invia il contesto

Invii il contesto esistente nella tua applicazione all'API Aether.

02
Si determina la modalità

Se non ci sono query, si applica l'ottimizzazione Generale; se ci sono query, si applica l'ottimizzazione Basata su Query.

03
Il contesto viene ottimizzato

Aether determina il carico che può essere ridotto preservando le informazioni utilizzabili.

04
Ricevi il risultato

Il contesto ottimizzato ritorna direttamente alla tua applicazione.

Modalità di Ottimizzazione

Che ci sia o meno una query.

Puoi utilizzare due diversi tipi di ottimizzazione in base a come verrà utilizzato il contesto.

Modalità 01
General

Contesto generaleottimizzare preservando.

Puoi usare la modalità Generale quando desideri ottimizzare il contesto senza una domanda specifica dell'utente.

Memoria della ConversazioneStato dell'AgenteContesto Generale
Modalità 02
Query-Aware

Context'iconcentrati sulla query.

Se la domanda dell'utente è nota, la query può essere aggiunta alla richiesta di ottimizzazione. In questo modo il contesto di Aether gestisce l'informazione tenendo conto del bisogno informativo di quella query.

RAGDomanda e Risposta sul DocumentoAssistenza Clienti
Qual è la differenza?

Un altro modelloeklemiyoruz.

Fare una nuova chiamata LLM per ridurre il costo del contesto potrebbe significare spostare il costo altrove. Aether Compress non basa la sua ottimizzazione su una chiamata LLM separata.

Ottimizzazione senza LLM

Aether Compress non invia richieste a un altro modello di intelligenza artificiale per ottimizzare il contesto.

Indipendente dal Fornitore

Il contesto ottimizzato può essere utilizzato nella fase successiva con il modello o il fornitore che preferisci.

Davanti al Flusso Esistente

Non è necessario cambiare il tuo modello, l'architettura del prompt o il livello principale LLM della tua applicazione.

Risultato Misurabile

Puoi misurare il risultato confrontando il numero di token originali e ottimizzati in ogni richiesta.

Flusso API

Prendi solo il contesto.Se vuoi, continua fino alla risposta.

Aether Compress è lo strato di ottimizzazione del prodotto. Aether Generate invece è l'uso opzionale che unisce questo strato con il tuo provider AI in una sola chiamata.

Aether Compress
Solo Ottimizza
Nessuna Chiamata AI
INPUTcontext
AETHERcompress
OUTPUTdata.compressed

Il contesto ottimizzato torna direttamente alla tua applicazione. Decidi tu con quale modello, quando e come utilizzarlo.

Aether Generate
Ottimizza + Genera
BYOK
INPUTcontext
AETHERcompress
PROVIDERyour_llm
OUTPUTresponse

Il contesto viene prima ottimizzato, quindi inviato al modello tramite il tuo account fornitore e la risposta finale ritorna in un unico flusso.

Entegrasyon

Con una singola chiamata APIaggiungilo al tuo flusso.

È sufficiente inserire Aether Compress tra la fase di creazione del contesto esistente e la tua chiamata LLM.

Consulta la documentazione
POST /v1/compress
const response = await fetch(
  "https://api.aether.tr/v1/compress",
  {
    method: "POST",
    headers: {
      "Authorization": "Bearer YOUR_API_KEY",
      "Idempotency-Key": crypto.randomUUID(),
      "Content-Type": "application/json"
    },
    body: JSON.stringify({
      context,
      query
    })
  }
);

const result = await response.json();

console.log(result.context);
Before12,840
After7,620
Aree di utilizzo

Se il contesto cresce,potrebbe esserci un'area di ottimizzazione.

Aether si concentra sulla struttura del contesto inviato al LLM invece che su un settore specifico.

Assistenti AI

Ottimizza lunghe cronologie di conversazioni e contesti ripetuti prima della chiamata al modello.

Sistemi RAG

Rendi più efficienti i frammenti di documento ottenuti dal recupero in base alla query dell'utente.

Agente AI

Riduci il carico dei risultati degli strumenti, della cronologia delle attività e del contesto accumulato dell'agente.

Analisi dei Documenti

Non trasportare interamente rapporti lunghi, contratti e documenti aziendali ad ogni richiesta.

Assistenza Clienti

Ottimizza la cronologia delle conversazioni, le informazioni sui clienti e il contesto del centro assistenza.

Codice & Contenuti Tecnici

Riduci grandi contesti che contengono codice sorgente, log, output di errori e documentazione tecnica.

Verifica

Non solo più piccolo.Anche le informazioni devono essere protette.

Quando valutiamo Aether Compress, non misuriamo solo la riduzione dei token. Verifichiamo anche separatamente che il contesto ottimizzato conservi le informazioni necessarie.

Esamina i risultati del benchmark
100.000
Scenario di verifica locale
40,65%
Riduzione media dell'input
500 / 500
Verifica con modello esterno
52,67%
Massima riduzione misurata
Nota di misurazione: Il valore 40,65 è la riduzione media dell'input su un set di convalida di 100.000 scenari. Il risultato reale varia in base alla struttura del contesto. Il valore 3,48 ms è il tempo medio di elaborazione misurato nell'ambiente di convalida.
Il controllo è nelle vostre mani

Se non c'è riduzione sicuranon è obbligatorio ridurre.

L'obiettivo non è produrre un output più piccolo in ogni caso. Più importante della riduzione del contesto da proteggere è la conservazione delle informazioni utilizzabili.

Misurate

Non guardate alla media del marketing,darvi un'occhiata al vostro contesto.

Ogni applicazione ha una struttura di contesto diversa. Il modo più corretto per vedere il vero valore di Aether è misurarlo sui propri input di produzione.

Quando è significativo?

Quando il costo del contesto è reale.

Contesto lungo

Se le vostre richieste trasportano la cronologia delle conversazioni, documenti o il contesto di sistemi grandi.

Alto volume di chiamate

Nei sistemi dove la stessa ottimizzazione viene ripetuta in migliaia o milioni di richieste.

Prompt molto breve

Se l'input è già a livello di pochi token, lo spazio che può essere ridotto è naturalmente limitato.

Contesto già minimo

Se il tuo contesto è stato precedentemente minimizzato in modo aggressivo, il guadagno aggiuntivo potrebbe essere inferiore.

Aether Compress

Invia il tuo contesto.Vedi la differenza nei tuoi dati.

Testa Aether Compress con 1 milione di token gratuiti su input reali simili al tuo contesto di produzione.

Nessuna carta di credito richiesta
1M token gratuiti