AETHER · Benchmark & Convalida

Meno token.Risultati misurati.

Misuriamo Aether Compress non solo in base a quanto riduce, ma anche in base a quanto conserva l'informazione necessaria durante la riduzione. I nostri risultati sono valutati tramite test locali su larga scala e verifica indipendente del modello.

40,65%
Riduzione media dell'input
100K+
scenario di test
100%
successo nella conservazione dell'informazione
3,48 ms
Tempo medio di elaborazione
Architettura di verifica

Due diversi livelli di test.

La verifica locale testa la perdita di informazioni su larga scala. La verifica del modello esterno misura se la risposta generata dal contesto ottimizzato trasporta le stesse informazioni del contesto originale.

Livello 01
Autenticazione Locale
100.000
scenario di test
100%
riuscito
40,65%
riduzione media
52,67%
massimo misurato
3,48 ms
tempo medio
Livello 02
Validazione Modello Esterno
500 / 500
scenario convalidato
100%
precisione della risposta misurata
25,13%
riduzione nel set selezionato
500
test concluso
0
test fallito
Perché i tassi sono diversi? Il valore del 40,65% è la media del set di autenticazione locale di 100.000 scenari. Il 25,13% è invece la misurazione del sottoinsieme separato di 500 scenari selezionato per la validazione del modello esterno. I due valori non rappresentano lo stesso gruppo di test.
Riduzione dell'Input

Ortalama%40,65 in meno.

Il valore misurato indica la riduzione media del numero di token rispetto all'input originale per l'input ottimizzato.

Input Originale
100%
Dopo Aether
59,35%
Normal
Ottimizzato
Ridotto%40,65
Misurazione 01
Essere più piccolonon è un successo da solo.

Durante la valutazione di Aether Compress, non si misura solo la riduzione dei token. La condizione principale di successo è che il contesto ottimizzato mantenga le informazioni necessarie.

Misurazione 02
Risposta finaleè anche verificata.

Nello strato di verifica esterna, la stessa domanda viene valutata sia attraverso il contesto originale sia attraverso quello ottimizzato e viene misurato se le risposte mantengono le informazioni necessarie.

Kapsam

Non misuriamo in base a un solo tipo di contenuto.

Il set di test è composto da scenari con diverse caratteristiche di densità, struttura e contesto.

01
Informazioni dirette
02
Informazioni multiple
03
Contesto lungo
04
Focalizzato sulla query
05
Contenuto strutturato
06
Contenuto tecnico
07
Contesto del codice
08
Contenuto misto
09
Contenuto ripetitivo
10
Bassa ridondanza
11
Alta ridondanza
12
Casi limite
Metodoloji

La stessa misurazione, processo ripetibile.

Il processo di benchmark misura separatamente l'input originale, l'input ottimizzato e il risultato della verifica.

01
Orijinal

L'input di test viene preso come riferimento senza modifiche.

02
Optimize

Lo stesso input viene elaborato con Aether Compress.

03
Confronta

La riduzione dei token e la conservazione delle informazioni sono misurate separatamente.

04
Verifica

I test selezionati vengono controllati separatamente anche tramite il modello esterno.

Durante la lettura dei risultati

Limiti di misurazione

Il 40,65% non è garantito

Il tasso di riduzione varia in base alla struttura dell'input e alla quantità di informazioni non necessarie contenute.

3,48 ms non è una latenza universale

Questo è il tempo medio di elaborazione misurato nell'ambiente di validazione dei valori. Può variare in base all'hardware e al carico di lavoro.

Il 52,67% è la misura massima

Questo valore rappresenta la massima riduzione osservata nel set di validazione e non è il tasso previsto per ogni richiesta.

Precisione misurata

Il valore del 100% nella convalida esterna è il risultato dei 500 scenari testati e non garantisce valori per tutti gli input possibili.

Misura con i tuoi dati

Più importante del benchmark,sono i tuoi input.

Prova gratuitamente _AETHER_COMPRESS__ e scopri quanti token puoi ridurre nel tuo contesto reale.

Provalo gratuitamente
Nessuna carta di credito richiesta
1M Token gratuiti