AETHER · Бенчмарк и проверка

Меньше токенов.Измеренные результаты.

Мы измеряем _AETHER_COMPRESS__ не только по тому, насколько он уменьшает размер, но и по тому, насколько хорошо сохраняет необходимую информацию при уменьшении. Наши результаты оцениваются с помощью широкомасштабного локального тестирования и независимой проверки модели.

40,65%
среднее уменьшение входных данных
100K+
тестовый сценарий
100%
успех сохранения информации
3,48 мс
среднее время обработки
Архитектура проверки

Два разных тестовых уровня.

Локальная проверка тестирует потерю информации в широком масштабе. Внешняя проверка модели измеряет, несет ли ответ, сгенерированный из оптимизированного контекста, ту же информацию, что и исходный контекст.

Слой 01
Локальная проверка
100.000
тестовый сценарий
100%
успешно
40,65%
среднее снижение
52,67%
измеренный максимум
3,48 мс
среднее время
Слой 02
Внешняя проверка модели
500 / 500
проверенный сценарий
100%
измеренная точность ответа
25,13%
снижение в выбранном наборе
500
завершенный тест
0
неудачный тест
Почему показатели разные? Значение 40,65% является средним для набора локальной проверки из 100 000 сценариев. А 25,13% — это измерение для отдельного поднабора из 500 сценариев, выбранного для внешней проверки модели. Два значения не представляют одну и ту же тестовую группу.
Снижение ввода

OrtalamaНа 40,65% меньше.

Измеренное значение показывает среднее уменьшение количества токенов по сравнению с исходным вводом для оптимизированного ввода.

Исходный ввод
100%
После Aether
59,35%
Normal
Оптимизированный
Сокращено%40,65
Измерение 01
Быть меньшесамо по себе не является успехом.

При оценке Aether Compress измеряется не только сокращение токенов. Основным условием успеха является сохранение необходимой информации в оптимизированном контексте.

Измерение 02
Окончательный ответтакже проверяется.

На уровне внешней проверки один и тот же вопрос оценивается как по исходному, так и по оптимизированному контексту, и измеряется, сохраняют ли ответы необходимую информацию.

Kapsam

Мы не измеряем по одному типу контента.

Тестовый набор состоит из сценариев с различной плотностью, структурой и характеристиками контекста.

01
Прямая информация
02
Множественная информация
03
Длинный контекст
04
Ориентировано на запрос
05
Структурированный контент
06
Технический контент
07
Контекст кода
08
Смешанный контент
09
Повторяющийся контент
10
Низкая избыточность
11
Высокая избыточность
12
Краевые случаи
Metodoloji

То же измерение, повторяемый процесс.

Процесс бенчмаркинга измеряет исходный ввод, оптимизированный ввод и результат проверки отдельно друг от друга.

01
Orijinal

Тестовый ввод берется в качестве ссылки без изменений.

02
Optimize

Тот же ввод обрабатывается с помощью Aether Compress.

03
Сравнить

Снижение токенов и сохранение информации измеряются отдельно.

04
Проверить

Выбранные тесты дополнительно проверяются на другой модели.

При чтении результатов

Границы измерений

40,65% не гарантируется

Процент снижения зависит от структуры ввода и количества лишней информации.

3,48 мс не является универсальной задержкой

Это среднее время обработки, измеренное в среде проверки. Может изменяться в зависимости от оборудования и рабочей нагрузки.

52,67% — это максимальное измерение

Это значение показывает максимальное сокращение, наблюдаемое в наборе проверки, и не является ожидаемой нормой для каждого запроса.

Точность измерена

Значение 100% во внешней проверке является результатом теста 500 сценариев и не гарантирует для всех возможных входных данных без ограничений.

Измерьте со своими данными

Более важно, чем бенчмарк,ваш ввод.

Попробуйте _AETHER_COMPRESS__ бесплатно и посмотрите, насколько вы можете сократить токены в вашем собственном реальном контексте.

Попробуйте бесплатно
Кредитная карта не требуется
1М бесплатных токенов