AETHER · Anwendungsfälle

Der Kontext wächst.Die Last muss nicht wachsen.

Von AI-Assistenten bis hin zu RAG-Systemen, von Agent-Workflows bis zur Dokumentenanalyse kann Aether Compress an verschiedene Nutzungsszenarien angepasst werden, bei denen die unnötige Eingabelast, die an LLM gesendet wird, reduziert werden kann.

Häufiges Problem

Anwendungen sind unterschiedlich.Das Kontextproblem ist dasselbe.

Mit dem Wachstum der KI-Anwendungen wachsen auch die an das Modell gesendeten Informationen. wächst. Gesprächsverläufe, Abrufergebnisse, Tool Ausgaben, Dokumentation und Systemanweisungen bei jeder neuen Anfrage. Es wird Teil der Inputkosten.

Aether erstellt eine separate Schicht, in der diese Last optimiert werden kann, bevor sie das LLM erreicht.

Kontextpipeline
01
Uygulama
Kontext entsteht
02
Aether Compress
Die Eingabe ist optimiert
03
LLM
Es wird ein kleinerer Kontext gesendet
Entegrasyonvor dem aktuellen Fluss
Wo wird es verwendet?

Überall dort, wo Kontext verwendet wirdMöglicherweise besteht Optimierungspotenzial.

Der Einsatzbereich ist mehr als der Sektor, es ist der an LLM gesendete Input. Es geht um die Struktur.

01 · KI-Assistenten
Komprimieren + Generieren

Führen Sie lange Gespräche leichter.

Wenn KI-Assistenten wachsen, können Gesprächsverläufe, Systemanweisungen und zusätzlicher Kontext bei jeder Anfrage erneut übertragen werden. Aether Compress hilft dabei, die Input-Belastung zu reduzieren, indem es den an das Modell zu sendenden Kontext optimiert.

Lange GesprächsgeschichtenSystem- und BenutzerkontextDoppelte Sitzungsinformationen
02 · RAG-Systeme
Abfrageorientiert

Sie müssen nicht den gesamten abgerufenen Kontext verschieben.

Die Retrieval-Schicht kann für eine Anfrage viele Dokumentenfragmente zurückgeben. Aether hilft Ihnen, den abgerufenen Kontext vor dem LLM-Aufruf zu optimieren, um einen kleineren Input zu erstellen.

Stücke abgerufenWissensdatenbankenDokumentbasierte Frage und Antwort
03 · Kundensupport
Komprimieren + Generieren

Reichen Sie nicht für jede Supportanfrage die gleiche Last erneut ein.

Support-Bots können Kundenhistorie, Produktdokumentationen, vorherige Nachrichten und Support-Regeln in einer einzigen Anfrage enthalten. Aether ermöglicht die Optimierung dieses Kontexts vor dem LLM.

UnterstützungsredenKundenhistorieInhalte des Hilfecenters
04 · KI-Agent
Compress

Wenn der Agent wächst, muss nicht auch der Kontext wachsen.

In Agentensystemen können Werkzeugergebnisse, Aufgabenverlauf und Zwischenschritte schnell im Kontext akkumulieren. Aether kann genutzt werden, um die Inputlast vor dem nächsten Modellaufruf zu reduzieren.

WerkzeugausgängeAufgabenverlaufMehrstufige Arbeitsabläufe
05 · Code und technischer Inhalt
Compress

Senden Sie große technische Zusammenhänge effizienter.

Code-Assistenten und technische KI-Werkzeuge können Quellcode, Fehlermeldungen, Konfigurationen und Dokumentationen im gleichen Kontext übertragen. Aether kann diese Eingaben vor dem Modellaufruf optimieren.

Quellcode-KontextProtokoll- und FehlerausgabenTechnische Dokumentation
06 · Dokumentenanalyse
Abfrageorientiert

Verschieben Sie lange Dokumente nicht für jede Frage erneut.

In KI-Anwendungen, die an Berichten, Verträgen, Handbüchern und Unternehmensdokumenten arbeiten, kann der erforderliche Kontext entsprechend der Abfrage optimiert und kleinere Eingaben an das Modell gesendet werden.

Berichte und VerträgeUnternehmensdokumenteLangtextanalyse
Zwei Optimierungsansätze

Je nach Kontext.Laut Anfrage.

Allgemeine Optimierung
ohne RückfrageKontextoptimierung.

Inhalte optimieren, ohne sie an eine bestimmte Frage zu binden Es kann in den gewünschten Streams verwendet werden. Gesprächsverläufe, Beispiele hierfür sind Systeme, die den Agentenstatus oder den allgemeinen Kontext übertragen.

KI-AssistentAgentTechnischer Kontext
Abfrageorientiert
Wenn die Frage bekannt istNutzen Sie auch den Fokus.

Wenn die Anfrage des Benutzers im Voraus bekannt ist, kann Aether die Anfrage in den Optimierungsprozess einbeziehen und den Kontext auf diese Anfrage fokussiert verarbeiten.

RAGFragen und Antworten zum DokumentDestek
Beispiel · RAG

Wenn der Abruf beendet istDie Optimierung kann beginnen.

Aether ersetzt nicht das Retrieval-System. Es wird zwischen dem Retrieval-Ergebnis und dem LLM-Aufruf eingefügt.

01
Benutzerabfrage

Ihre App beantwortet die Frage.

02
Retrieval

Ihre bestehende RAG-Infrastruktur ruft die relevanten Dokumentfragmente ab.

03
Aether Compress

Der abgerufene Kontext wird unter Berücksichtigung der Benutzeranfrage optimiert.

04
LLM

Der optimierte Kontext wird an Ihren aktuellen Modellanbieter gesendet.

Hohe Lautstärke
kleine Ersparnissenimmt an Volumen zu.

Der Unterschied zwischen den Tokens in einer einzelnen Anfrage mag gering erscheinen. Gleiche Optimierung bei Tausenden oder Millionen von LLM-Aufrufen Bei Wiederholung vergrößert sich der Unterschied im Gesamteingabevolumen.

Aktuelle Architektur
ModeliniziSie müssen es nicht ändern.

Aether ist keine Modellwahl. Da es in der Phase der Kontextvorbereitung arbeitet, kann es vor Ihren bestehenden AI-Fluss gesetzt werden.

Branchenunabhängig

Wenn das Problem Token sind,Der Sektor befindet sich im Hintergrund.

Aether ist keine Optimierungsschicht, die nach der Terminologie einer bestimmten Branche gestaltet wurde. Daher kann dieselbe Architektur in verschiedenen AI-Anwendungen verwendet werden.

SaaS

Softwareprodukte, die KI-Funktionen nutzen.

E-ticaret

Produkt-, Support- und Einkaufsassistenten.

Finans

Dokumenten- und wissensbasierte KI-Anwendungen.

Hukuk

Lange Dokumenten- und Vertragsanalyse.

Kurumsal

Interne Wissensdatenbanken und Mitarbeiterassistenten.

Entwicklertools

Anwendungen, die Code, Protokolle und technischen Kontext verwenden.

Zwei Verwendungsmöglichkeiten

Holen Sie sich den Kontext.Oder erhalten Sie die Antwort.

Option 01
Aether Compress
Nur optimieren

Der optimierte Kontext kehrt direkt zu Ihrer Anwendung zurück. Ihre bestehende Infrastruktur führt den nächsten LLM-Aufruf selbst durch.

POST /v1/compress
Option 02
Aether Generate
Einzelner Stream

Der Kontext wird zunächst mit Aether Compress optimiert, anschließend an den von Ihnen gewählten AI-Anbieter gesendet und die endgültige Antwort wird in Ihre Anwendung zurückgegeben.

Komprimieren → Anbieter → Antwort
Richtige Verwendung

Nicht jede Anfrage muss komprimiert werden.

Sehr kurze Eingaben

Wenn der Kontext bereits sehr klein ist, ist der Optimierungsaufwand möglicherweise begrenzt.

Geringes Wiederholungsvolumen

Bei Anwendungen, die nur sehr wenige LLMs erfordern, können die wirtschaftlichen Gesamtauswirkungen naturgemäß geringer ausfallen.

Es ist bereits ein minimaler Kontext

Wenn die Eingabe bereits stark optimiert wurde, kann der Spielraum für weitere Reduzierungen begrenzt sein.

Zuerst messen

Die genaueste Entscheidung wird getroffen, indem Aether an Ihren eigenen echten Eingaben getestet wird.

Ihr eigenes Szenario

Bester AnwendungsfallIhre echten Daten.

Probieren Sie Aether Compress in Ihrem eigenen Kontext aus und messen Sie, wie viel Platz es in Ihrer Eingabelast hat.

Probieren Sie es kostenlos aus
Keine Kreditkarte erforderlich
1 Mio. kostenlose Token