AETHER · Benchmark & Doğrulama

Daha az token.Ölçülmüş sonuçlar.

Aether Compress'i yalnızca ne kadar küçülttüğüyle değil, küçültürken gerekli bilgiyi ne kadar koruduğuyla ölçüyoruz. Sonuçlarımız geniş ölçekli yerel testler ve bağımsız model doğrulamasıyla değerlendiriliyor.

40,65%
ortalama input azaltımı
100K+
test senaryosu
100%
bilgi koruma başarısı
3,48 ms
ortalama işlem süresi
Doğrulama Mimarisi

İki farklı test katmanı.

Yerel doğrulama bilgi kaybını geniş ölçekte test eder. Harici model doğrulaması ise optimize edilen bağlamdan üretilen cevabın orijinal bağlamla aynı bilgiyi taşıyıp taşımadığını ölçer.

Katman 01
Yerel Doğrulama
100.000
test senaryosu
100%
başarılı
40,65%
ortalama azaltım
52,67%
ölçülen maksimum
3,48 ms
ortalama süre
Katman 02
Harici Model Doğrulaması
500 / 500
doğrulanmış senaryo
100%
ölçülen cevap doğruluğu
25,13%
seçili kümede azaltım
500
sonuçlandırılmış test
0
başarısız test
Neden oranlar farklı? 40,65% değeri 100.000 senaryoluk yerel doğrulama kümesinin ortalamasıdır. 25,13% ise harici model doğrulaması için seçilen 500 senaryoluk ayrı alt kümenin ölçümüdür. İki değer aynı test grubunu temsil etmez.
Input Azaltımı

Ortalama%40,65 daha az.

Ölçülen değer, optimize edilen girdinin orijinal girdiye göre token miktarındaki ortalama azalmayı gösterir.

Orijinal Input
100%
Aether Sonrası
59,35%
Normal
Optimize edilmiş
Azaltılan%40,65
Ölçüm 01
Daha küçük olmaktek başına başarı değildir.

Aether Compress değerlendirilirken yalnızca token azaltımı ölçülmez. Optimize edilen bağlamın gerekli bilgiyi koruması birincil başarı koşuludur.

Ölçüm 02
Nihai cevapayrıca doğrulanır.

Harici doğrulama katmanında aynı soru hem orijinal hem de optimize edilmiş bağlam üzerinden değerlendirilir ve cevapların gerekli bilgiyi koruyup korumadığı ölçülür.

Kapsam

Tek bir içerik türünegöre ölçmüyoruz.

Test kümesi farklı yoğunluk, yapı ve bağlam özelliklerine sahip senaryolardan oluşur.

01
Doğrudan Bilgi
02
Çoklu Bilgi
03
Uzun Bağlam
04
Sorgu Odaklı
05
Yapısal İçerik
06
Teknik İçerik
07
Kod Bağlamı
08
Karışık İçerik
09
Tekrarlı İçerik
10
Düşük Fazlalık
11
Yüksek Fazlalık
12
Sınır Durumları
Metodoloji

Aynı ölçüm, tekrar edilebilir süreç.

Benchmark süreci orijinal girdi, optimize edilmiş girdi ve doğrulama sonucunu birbirinden ayrı olarak ölçer.

01
Orijinal

Test girdisi değişmeden referans olarak alınır.

02
Optimize

Aynı girdi Aether Compress ile işlenir.

03
Karşılaştır

Token azaltımı ve bilgi korunumu ayrı ayrı ölçülür.

04
Doğrula

Seçili testler harici model üzerinden ayrıca kontrol edilir.

Sonuçları Okurken

Ölçüm sınırları

%40,65 garanti değildir

Azaltım oranı girdinin yapısına ve içerdiği gereksiz bilgi miktarına göre değişir.

3,48 ms evrensel gecikme değildir

Bu değer doğrulama ortamında ölçülen ortalama işlem süresidir. Donanım ve iş yüküne göre değişebilir.

%52,67 maksimum ölçümdür

Bu değer doğrulama kümesinde gözlenen en yüksek azaltımı gösterir ve her istek için beklenen oran değildir.

Doğruluk ölçülmüştür

Harici doğrulamadaki %100 değer, test edilen 500 senaryonun sonucudur ve sınırsız tüm olası girdiler için garanti anlamına gelmez.

Kendi Verinizle Ölçün

Benchmark'tan daha önemlisi,sizin girdiniz.

Aether Compress'i ücretsiz deneyin ve kendi gerçek bağlamınızda ne kadar token azaltabileceğinizi görün.

Ücretsiz Deneyin
Kredi kartı gerekmez
1M Ücretsiz token