Il contesto cresce.Il carico non deve necessariamente crescere.
Dagli assistenti AI ai sistemi RAG, dai flussi di lavoro degli agenti all'analisi dei documenti, Aether Compress può essere adattato a diversi scenari di utilizzo in cui è possibile ridurre il carico di input inutile inviato all'LLM.
Le applicazioni sono diverse.Il problema del contesto è lo stesso.
Man mano che le applicazioni AI crescono, crescono anche le informazioni inviate al modello. Cronologie delle conversazioni, risultati del retrieval, output degli strumenti, documenti e istruzioni di sistema diventano parte del costo di input a ogni nuova richiesta.
Aether crea un livello separato in cui questo carico può essere ottimizzato prima di raggiungere l'LLM.
Ovunque si utilizzi il contestopuò essere uno spazio per l'ottimizzazione.
L'area di utilizzo riguarda più la struttura dell'input inviato al LLM che il settore.
Gestisci conversazioni lunghe più leggermente.
Man mano che gli assistenti AI crescono, la cronologia delle conversazioni, le istruzioni di sistema e il contesto aggiuntivo possono essere trasportati di nuovo ad ogni richiesta. Aether Compress aiuta a ridurre il carico di input ottimizzando il contesto inviato al modello.
Non è necessario trasportare l'intero contesto recuperato.
Il livello di retrieval può restituire molti frammenti di documento per una singola query. Aether aiuta a ottimizzare il contesto recuperato prima della chiamata LLM, creando un input più piccolo.
Non inviare lo stesso carico ad ogni richiesta di supporto.
I bot di supporto possono trasportare cronologia del cliente, documenti del prodotto, messaggi precedenti e regole di supporto in una singola richiesta. Aether consente di ottimizzare questo contesto prima dell'LLM.
Man mano che l'agente cresce, anche il contesto non deve necessariamente crescere.
Nei sistemi agenti, i risultati degli strumenti, la cronologia delle attività e i passaggi intermedi possono accumularsi rapidamente nel contesto. Aether può essere utilizzato per ridurre il carico di input trasportato prima della successiva chiamata del modello.
Invia il contesto tecnico più ampio in modo più efficiente.
Assistenti di codice e strumenti AI tecnici; possono trasportare codice sorgente, log di errori, configurazioni e documentazione nello stesso contesto. Aether può ottimizzare questo input prima della chiamata al modello.
Non trasportare nuovamente documenti lunghi in ogni domanda.
Nelle applicazioni AI che lavorano su rapporti, contratti, guide e documenti aziendali, il contesto necessario può essere ottimizzato in base alla query per inviare un input più piccolo al modello.
In base al contesto.In base alla domanda.
Può essere usato nei flussi in cui si desidera ottimizzare i contenuti senza collegarli a una domanda specifica. Conversazioni precedenti, stato dell'agente o sistemi che trasportano contesto generale sono esempi.
Se la query dell'utente è nota in anticipo, Aether, può elaborare il contesto in modo mirato alla richiesta includendo la query nel processo di ottimizzazione.
Quando il retrieval è completatol'ottimizzazione può iniziare.
Aether non sostituisce il sistema di retrieval. Viene inserito tra il risultato del retrieval e la chiamata LLM.
L'applicazione riceve la domanda.
La vostra infrastruttura RAG esistente recupera le parti di documento rilevanti.
Il contesto recuperato viene ottimizzato tenendo conto della query dell'utente.
Il contesto ottimizzato viene inviato al fornitore del modello esistente.
La differenza di token in una singola richiesta può sembrare piccola. La stessa ottimizzazione, ripetuta in migliaia o milioni di chiamate LLM, aumenta la differenza del volume totale di input.
Aether non è una scelta di modello. Poiché funziona durante la fase di preparazione del contesto, può essere aggiunto davanti al flusso AI esistente.
Se il token è un problema,il settore è secondario.
Aether non è un livello di ottimizzazione progettato secondo la terminologia di un settore specifico. Pertanto, la stessa architettura può essere utilizzata in diverse applicazioni AI.
Prodotti software che utilizzano funzionalità AI.
Prodotto, supporto e assistenti per lo shopping.
Applicazioni AI basate su documenti e knowledge base.
Analisi di documenti lunghi e contratti.
Knowledge base interne e assistenti per i dipendenti.
Applicazioni che utilizzano codice, log e contesto tecnico.
Prendi il context.O prendi la risposta.
Il context ottimizzato torna direttamente alla tua applicazione. La chiamata successiva del LLM la gestisce l’infrastruttura esistente.
Il context viene prima ottimizzato con Aether Compress, poi inviato al fornitore AI da te scelto e la risposta finale torna alla tua applicazione.
Non tutte le richieste devono essere compresse.
Se il context è già molto piccolo, il carico inutile dell’ottimizzazione può essere limitato.
Negli applicativi che richiedono pochissime chiamate LLM, l'impatto economico totale può naturalmente essere più basso.
Se l'input è già stato ottimizzato intensivamente, lo spazio di riduzione aggiuntivo può essere limitato.
La decisione più corretta si ottiene testando Aether con i vostri input reali.
Il miglior scenario d'usoI vostri dati reali.
Provate Aether Compress con il vostro contesto e misurate quanto spazio avete sul vostro input.
