AETHER · Scenari di utilizzo

Il contesto cresce.Il carico non deve necessariamente crescere.

Dagli assistenti AI ai sistemi RAG, dai flussi di lavoro degli agenti all'analisi dei documenti, Aether Compress può essere adattato a diversi scenari di utilizzo in cui è possibile ridurre il carico di input inutile inviato all'LLM.

Problema comune

Le applicazioni sono diverse.Il problema del contesto è lo stesso.

Man mano che le applicazioni AI crescono, crescono anche le informazioni inviate al modello. Cronologie delle conversazioni, risultati del retrieval, output degli strumenti, documenti e istruzioni di sistema diventano parte del costo di input a ogni nuova richiesta.

Aether crea un livello separato in cui questo carico può essere ottimizzato prima di raggiungere l'LLM.

Pipeline del contesto
01
Uygulama
Si crea il contesto
02
Aether Compress
L'input viene ottimizzato
03
LLM
Viene inviato un contesto più piccolo
EntegrasyonDavanti al flusso esistente
Dove viene utilizzato?

Ovunque si utilizzi il contestopuò essere uno spazio per l'ottimizzazione.

L'area di utilizzo riguarda più la struttura dell'input inviato al LLM che il settore.

01 · Assistenti AI
Comprimi + Genera

Gestisci conversazioni lunghe più leggermente.

Man mano che gli assistenti AI crescono, la cronologia delle conversazioni, le istruzioni di sistema e il contesto aggiuntivo possono essere trasportati di nuovo ad ogni richiesta. Aether Compress aiuta a ridurre il carico di input ottimizzando il contesto inviato al modello.

Storie di conversazioni lungheContesto del sistema e dell'utenteInformazioni di sessione ripetute
02 · Sistemi RAG
Focalizzato sulla query

Non è necessario trasportare l'intero contesto recuperato.

Il livello di retrieval può restituire molti frammenti di documento per una singola query. Aether aiuta a ottimizzare il contesto recuperato prima della chiamata LLM, creando un input più piccolo.

Frammenti recuperatiBasi di conoscenzaDomande e risposte basate sui documenti
03 · Assistenza Clienti
Comprimi + Genera

Non inviare lo stesso carico ad ogni richiesta di supporto.

I bot di supporto possono trasportare cronologia del cliente, documenti del prodotto, messaggi precedenti e regole di supporto in una singola richiesta. Aether consente di ottimizzare questo contesto prima dell'LLM.

Conversazioni di supportoCronologia del clienteContenuti del centro assistenza
04 · Agente AI
Compress

Man mano che l'agente cresce, anche il contesto non deve necessariamente crescere.

Nei sistemi agenti, i risultati degli strumenti, la cronologia delle attività e i passaggi intermedi possono accumularsi rapidamente nel contesto. Aether può essere utilizzato per ridurre il carico di input trasportato prima della successiva chiamata del modello.

Output degli strumentiCronologia delle attivitàFlussi di lavoro multi-step
05 · Codice & Contenuti Tecnici
Compress

Invia il contesto tecnico più ampio in modo più efficiente.

Assistenti di codice e strumenti AI tecnici; possono trasportare codice sorgente, log di errori, configurazioni e documentazione nello stesso contesto. Aether può ottimizzare questo input prima della chiamata al modello.

Contesto del codice sorgenteLog e output degli erroriDocumentazione tecnica
06 · Analisi dei Documenti
Focalizzato sulla query

Non trasportare nuovamente documenti lunghi in ogni domanda.

Nelle applicazioni AI che lavorano su rapporti, contratti, guide e documenti aziendali, il contesto necessario può essere ottimizzato in base alla query per inviare un input più piccolo al modello.

Rapporti e contrattiDocumenti aziendaliAnalisi di testi lunghi
Due Approcci di Ottimizzazione

In base al contesto.In base alla domanda.

Ottimizzazione Generale
Senza domandaOttimizzazione del contesto.

Può essere usato nei flussi in cui si desidera ottimizzare i contenuti senza collegarli a una domanda specifica. Conversazioni precedenti, stato dell'agente o sistemi che trasportano contesto generale sono esempi.

Assistente AIAgentContesto Tecnico
Focalizzato sulla query
Se la domanda è notausa anche il focus.

Se la query dell'utente è nota in anticipo, Aether, può elaborare il contesto in modo mirato alla richiesta includendo la query nel processo di ottimizzazione.

RAGDomanda e Risposta sul DocumentoDestek
Esempio · RAG

Quando il retrieval è completatol'ottimizzazione può iniziare.

Aether non sostituisce il sistema di retrieval. Viene inserito tra il risultato del retrieval e la chiamata LLM.

01
Query dell'utente

L'applicazione riceve la domanda.

02
Retrieval

La vostra infrastruttura RAG esistente recupera le parti di documento rilevanti.

03
Aether Compress

Il contesto recuperato viene ottimizzato tenendo conto della query dell'utente.

04
LLM

Il contesto ottimizzato viene inviato al fornitore del modello esistente.

Alto Volume
Piccoli risparmicrescono con il volume.

La differenza di token in una singola richiesta può sembrare piccola. La stessa ottimizzazione, ripetuta in migliaia o milioni di chiamate LLM, aumenta la differenza del volume totale di input.

Architettura Esistente
Modelinizinon è necessario modificare.

Aether non è una scelta di modello. Poiché funziona durante la fase di preparazione del contesto, può essere aggiunto davanti al flusso AI esistente.

Indipendente dal Settore

Se il token è un problema,il settore è secondario.

Aether non è un livello di ottimizzazione progettato secondo la terminologia di un settore specifico. Pertanto, la stessa architettura può essere utilizzata in diverse applicazioni AI.

SaaS

Prodotti software che utilizzano funzionalità AI.

E-ticaret

Prodotto, supporto e assistenti per lo shopping.

Finans

Applicazioni AI basate su documenti e knowledge base.

Hukuk

Analisi di documenti lunghi e contratti.

Kurumsal

Knowledge base interne e assistenti per i dipendenti.

Strumenti per sviluppatori

Applicazioni che utilizzano codice, log e contesto tecnico.

Due modalità di utilizzo

Prendi il context.O prendi la risposta.

Opzione 01
Aether Compress
Solo Ottimizza

Il context ottimizzato torna direttamente alla tua applicazione. La chiamata successiva del LLM la gestisce l’infrastruttura esistente.

POST /v1/compress
Opzione 02
Aether Generate
Flusso Unico

Il context viene prima ottimizzato con Aether Compress, poi inviato al fornitore AI da te scelto e la risposta finale torna alla tua applicazione.

Comprimi → Fornitore → Risposta
Uso Corretto

Non tutte le richieste devono essere compresse.

Input molto brevi

Se il context è già molto piccolo, il carico inutile dell’ottimizzazione può essere limitato.

Basso volume di ripetizione

Negli applicativi che richiedono pochissime chiamate LLM, l'impatto economico totale può naturalmente essere più basso.

Già contesto minimo

Se l'input è già stato ottimizzato intensivamente, lo spazio di riduzione aggiuntivo può essere limitato.

Misurate prima

La decisione più corretta si ottiene testando Aether con i vostri input reali.

Il vostro Scenario

Il miglior scenario d'usoI vostri dati reali.

Provate Aether Compress con il vostro contesto e misurate quanto spazio avete sul vostro input.

Provalo gratuitamente
Nessuna carta di credito richiesta
1M Token gratuiti