Invia menocontesto al LLM.
Aether Compress, ottimizza il tuo contesto prima della chiamata al modello. Riduce il carico inutile di token di input, mantiene le informazioni disponibili e permette al tuo flusso AI esistente di funzionare in modo più efficiente.
Funziona prima del modelloUno strato di ottimizzazione del contesto.
In una chiamata LLM, il modello elabora non solo la domanda, ma tutto il contesto che invii. Man mano che questo contesto cresce, aumenta anche la quantità di token di input.
Aether Compress si posiziona tra la tua applicazione e il modello. Ottimizza prima il contesto e produce un contesto più piccolo. Il passaggio successivo è completamente sotto il tuo controllo.
Parte del costo del modelloDeriva dal carico che invii al modello.
Un contesto più ampio non significa sempre informazioni più utili. Ripetizioni, contenuti di supporto e sezioni con bassa rilevanza rispetto alla query vengono anch'essi trasportati al modello come token di input.
Man mano che il contesto in input cresce, aumenta anche il numero di token inviati al provider e addebitati.
I contenuti non necessari consumano lo spazio del contesto che potrebbe essere utilizzato dalle informazioni veramente necessarie.
Una piccola differenza in una singola richiesta può trasformarsi in un grande numero totale di token con un volume elevato di chiamate.
Inserisce il contesto.Ottimizza il contesto.
Aether Compress, il modello non tenta di generare una risposta. Il suo compito è rendere l'input del contesto più efficiente prima di arrivare a LLM.
Invii il contesto esistente nella tua applicazione all'API Aether.
Se non ci sono query, si applica l'ottimizzazione Generale; se ci sono query, si applica l'ottimizzazione Basata su Query.
Aether determina il carico che può essere ridotto preservando le informazioni utilizzabili.
Il contesto ottimizzato ritorna direttamente alla tua applicazione.
Che ci sia o meno una query.
Puoi utilizzare due diversi tipi di ottimizzazione in base a come verrà utilizzato il contesto.
Contesto generaleottimizzare preservando.
Puoi usare la modalità Generale quando desideri ottimizzare il contesto senza una domanda specifica dell'utente.
Context'iconcentrati sulla query.
Se la domanda dell'utente è nota, la query può essere aggiunta alla richiesta di ottimizzazione. In questo modo il contesto di Aether gestisce l'informazione tenendo conto del bisogno informativo di quella query.
Un altro modelloeklemiyoruz.
Fare una nuova chiamata LLM per ridurre il costo del contesto potrebbe significare spostare il costo altrove. Aether Compress non basa la sua ottimizzazione su una chiamata LLM separata.
Aether Compress non invia richieste a un altro modello di intelligenza artificiale per ottimizzare il contesto.
Il contesto ottimizzato può essere utilizzato nella fase successiva con il modello o il fornitore che preferisci.
Non è necessario cambiare il tuo modello, l'architettura del prompt o il livello principale LLM della tua applicazione.
Puoi misurare il risultato confrontando il numero di token originali e ottimizzati in ogni richiesta.
Prendi solo il contesto.Se vuoi, continua fino alla risposta.
Aether Compress è lo strato di ottimizzazione del prodotto. Aether Generate invece è l'uso opzionale che unisce questo strato con il tuo provider AI in una sola chiamata.
Il contesto ottimizzato torna direttamente alla tua applicazione. Decidi tu con quale modello, quando e come utilizzarlo.
Il contesto viene prima ottimizzato, quindi inviato al modello tramite il tuo account fornitore e la risposta finale ritorna in un unico flusso.
Con una singola chiamata APIaggiungilo al tuo flusso.
È sufficiente inserire Aether Compress tra la fase di creazione del contesto esistente e la tua chiamata LLM.
Consulta la documentazioneconst response = await fetch(
"https://api.aether.tr/v1/compress",
{
method: "POST",
headers: {
"Authorization": "Bearer YOUR_API_KEY",
"Idempotency-Key": crypto.randomUUID(),
"Content-Type": "application/json"
},
body: JSON.stringify({
context,
query
})
}
);
const result = await response.json();
console.log(result.context);Se il contesto cresce,potrebbe esserci un'area di ottimizzazione.
Aether si concentra sulla struttura del contesto inviato al LLM invece che su un settore specifico.
Ottimizza lunghe cronologie di conversazioni e contesti ripetuti prima della chiamata al modello.
Rendi più efficienti i frammenti di documento ottenuti dal recupero in base alla query dell'utente.
Riduci il carico dei risultati degli strumenti, della cronologia delle attività e del contesto accumulato dell'agente.
Non trasportare interamente rapporti lunghi, contratti e documenti aziendali ad ogni richiesta.
Ottimizza la cronologia delle conversazioni, le informazioni sui clienti e il contesto del centro assistenza.
Riduci grandi contesti che contengono codice sorgente, log, output di errori e documentazione tecnica.
Non solo più piccolo.Anche le informazioni devono essere protette.
Quando valutiamo Aether Compress, non misuriamo solo la riduzione dei token. Verifichiamo anche separatamente che il contesto ottimizzato conservi le informazioni necessarie.
Esamina i risultati del benchmarkSe non c'è riduzione sicuranon è obbligatorio ridurre.
L'obiettivo non è produrre un output più piccolo in ogni caso. Più importante della riduzione del contesto da proteggere è la conservazione delle informazioni utilizzabili.
Non guardate alla media del marketing,darvi un'occhiata al vostro contesto.
Ogni applicazione ha una struttura di contesto diversa. Il modo più corretto per vedere il vero valore di Aether è misurarlo sui propri input di produzione.
Quando il costo del contesto è reale.
Se le vostre richieste trasportano la cronologia delle conversazioni, documenti o il contesto di sistemi grandi.
Nei sistemi dove la stessa ottimizzazione viene ripetuta in migliaia o milioni di richieste.
Se l'input è già a livello di pochi token, lo spazio che può essere ridotto è naturalmente limitato.
Se il tuo contesto è stato precedentemente minimizzato in modo aggressivo, il guadagno aggiuntivo potrebbe essere inferiore.
Invia il tuo contesto.Vedi la differenza nei tuoi dati.
Testa Aether Compress con 1 milione di token gratuiti su input reali simili al tuo contesto di produzione.
