weniger zu LLMKontext senden.
Aether Compress optimiert Ihren Kontext vor dem Modellaufruf. Es reduziert unnötige Input-Token-Belastung, erhält verfügbare Informationen und sorgt dafür, dass Ihr bestehender KI-Workflow effizienter arbeitet.
Arbeiten vor Modelleine Kontextoptimierungsschicht.
Bei einem LLM-Anruf stellt das Modell nicht nur die Frage, sondern auch Es verarbeitet den gesamten Kontext, den Sie senden. diesen Kontext Mit zunehmendem Wachstum steigt auch die Menge der Input-Tokens.
Aether Compress befindet sich zwischen Ihrer Anwendung und dem Modell. Es optimiert zuerst den Kontext und erzeugt einen kleineren Kontext. Der nächste Schritt liegt vollständig in Ihrer Kontrolle.
Teil der ModellkostenEs stammt aus der Nutzlast, die Sie an das Modell senden.
Ein größerer Kontext bedeutet immer mehr nützliche Informationen. Es kommt nicht. Wiederholungen, Hilfsinhalte und geringe Relevanz für die Suchanfrage Die Abschnitte werden auch als Eingabe-Tokens an das Modell übertragen.
Mit zunehmendem Eingabekontext steigt die Menge der gesendeten und dem Anbieter in Rechnung gestellten Token.
Unnötiger Inhalt verbraucht Kontextraum, den wirklich notwendige Informationen nutzen könnten.
Was bei einer einzelnen Anfrage wie ein kleiner Unterschied erscheinen mag, führt bei hohem Anrufvolumen zu großen Gesamttokenbeträgen.
Der Kontext tritt ein.Der optimierte Kontext wird angezeigt.
Aether Compress versucht nicht, eine Modellantwort zu erzeugen. Seine Aufgabe ist es, den Eingabekontext effizienter zu gestalten, bevor er das LLM erreicht.
Sie senden den vorhandenen Kontext in Ihrer Anwendung an die Aether API.
Wenn keine Abfrage vorhanden ist, wird die allgemeine Optimierung angewendet, und wenn eine Abfrage vorhanden ist, wird die abfrageorientierte Optimierung angewendet.
Aether bestimmt die Last, die reduziert werden kann, während die verfügbaren Informationen erhalten bleiben.
Der optimierte Kontext kehrt direkt zu Ihrer Anwendung zurück.
Abfrage oder nicht.
Es gibt zwei verschiedene Möglichkeiten, Kontext zu verwenden. Sie können das Optimierungsformat verwenden.
Allgemeiner KontextOptimieren und schützen.
Kontext ohne eine spezifische Benutzerfrage Allgemeiner Modus, wenn Sie optimieren möchten Sie können verwenden
Context'iKonzentrieren Sie sich auf die Anfrage.
Wenn die Frage des Benutzers bekannt ist, kann die Abfrage ebenfalls zur Optimierungsanfrage hinzugefügt werden. So verarbeitet Aether den Kontext unter Berücksichtigung des Informationsbedarfs dieser Anfrage.
Ein anderes Modelleklemiyoruz.
Einen neuen LLM-Aufruf zu machen, um die Kontextkosten zu reduzieren, kann bedeuten, die Kosten an eine andere Stelle zu verlagern. Aether Compress stützt seinen Optimierungsprozess nicht auf einen separaten LLM-Aufruf.
Aether Compress sendet keine Anfrage an ein anderes KI-Modell, um den Kontext zu optimieren.
Der optimierte Kontext kann im nächsten Schritt mit dem von Ihnen bevorzugten Modell oder Anbieter verwendet werden.
Sie müssen Ihr Modell, Ihre Eingabeaufforderungsarchitektur oder die Haupt-LLM-Schicht Ihrer Anwendung nicht ändern.
Sie können das Ergebnis messen, indem Sie die Menge der ursprünglichen und optimierten Token in jeder Anfrage vergleichen.
Holen Sie sich einfach den Kontext.Fahren Sie bis zur Antwort fort, wenn Sie möchten.
Aether Compress ist die Optimierungsschicht des Produkts. Aether Generate ist die optionale Nutzungsweise, die diese Schicht in einem einzigen Aufruf mit Ihrem KI-Anbieter kombiniert.
Der optimierte Kontext kehrt direkt zu Ihrer Anwendung zurück. Sie entscheiden, welches Modell, wann und wie Sie es verwenden. Sie bestimmen.
Zuerst wird der Kontext optimiert, dann der eigene Anbieter wird über Ihr Konto an das Modell gesendet und die endgültige Antwort rotiert in einem einzigen Fluss.
Mit einem einzigen API-AufrufFügen Sie es Ihrem Stream hinzu.
Es reicht aus, Aether Compress zwischen Ihre bestehende Kontextgenerierung und Ihren LLM-Aufruf einzufügen.
Überprüfen Sie die Dokumentationconst response = await fetch(
"https://api.aether.tr/v1/compress",
{
method: "POST",
headers: {
"Authorization": "Bearer YOUR_API_KEY",
"Idempotency-Key": crypto.randomUUID(),
"Content-Type": "application/json"
},
body: JSON.stringify({
context,
query
})
}
);
const result = await response.json();
console.log(result.context);Wenn der Kontext wächst,Es könnte sich um einen Optimierungsbereich handeln.
Aether konzentriert sich auf die an LLM gesendete Kontextstruktur, anstatt auf eine bestimmte Branche.
Optimieren Sie vor dem Model-Aufruf lange Gesprächsverläufe und sich wiederholenden Kontext.
Machen Sie die Dokumentfragmente, die als Ergebnis des Abrufs entstehen, je nach Benutzerabfrage effizienter.
Reduzieren Sie die Belastung durch Tool-Ausgaben, Aufgabenverlauf und akkumulierten Agentenkontext.
Tragen Sie nicht bei jeder Anfrage lange Berichte, Verträge und Unternehmensdokumente vollständig bei.
Optimieren Sie den Gesprächsverlauf, die Kundeninformationen und den Help-Center-Kontext.
Minimieren Sie große Kontexte mit Quellcode, Protokollen, Fehlerausgaben und technischer Dokumentation.
Nicht nur kleiner.Auch Informationen müssen geschützt werden.
Bei der Bewertung von Aether Compress messen wir nicht nur die Reduzierung der Token. Wir prüfen auch separat, ob der optimierte Kontext die erforderlichen Informationen beibehält.
Schauen Sie sich die Benchmark-Ergebnisse anWenn es keine sichere Reduzierung gibtMuss nicht reduziert werden.
Das Ziel besteht nicht darin, unter allen Umständen eine geringere Leistung zu erzielen. Wichtiger als die Reduzierung des Kontexts, der erhalten bleiben muss, Schutz nutzbarer Informationen.
Nicht der Marketingdurchschnitt,Schauen Sie sich Ihren eigenen Kontext an.
Die Kontextstruktur jeder Anwendung ist unterschiedlich. Der beste Weg, den tatsächlichen Wert von Aether zu sehen, besteht darin, dies mit Ihren eigenen Produktionsdaten zu messen.
Wenn die Kontextkosten tatsächlich vorhanden sind.
Wenn Ihre Anfragen einen Gesprächsverlauf, Dokumente oder einen großen Systemkontext enthalten.
In Systemen, in denen dieselbe Optimierung über Tausende oder Millionen von Anfragen hinweg wiederholt wird.
Liegt der Input bereits auf der Ebene einiger Token, ist der reduzierbare Platz naturgemäß begrenzt.
Wenn Ihr Kontext zuvor aggressiv minimiert wurde, ist der zusätzliche Gewinn möglicherweise geringer.
Senden Sie Ihren Kontext.Sehen Sie den Unterschied in Ihren eigenen Daten.
Testen Sie Aether Compress mit 1 Million kostenlosen Token an echten Eingaben, die Ihrem Produktionskontext ähneln.
