AETHER · Aether Compress

Отправляйте LLM меньшеконтента.

Aether Compress оптимизирует ваш контекст перед вызовом модели. Снижает ненужную нагрузку токенов ввода, сохраняет доступную информацию и обеспечивает более эффективную работу вашего текущего AI-потока.

Кредитная карта не требуется
1 млн бесплатных токенов
Aether Compress
Оптимизация контекста
Ready
Входной контекст12 840 токенов
Optimize
Оптимизированный контекст7 620 токенов
-40,65%
ortalama
3,48 мс
измеренный ср.
100%
результат теста
Вызова LLM нет·Не требует GPU·Контекст входной / контекст выходной
40,65%
среднее уменьшение входных данных
100K+
сценарий проверки
100%
измеренная точность ответа
3,48 мс
среднее время обработки
Что такое Aether Compress?

Работает перед модельюСлой оптимизации контекста.

При вызове LLM модель обрабатывает не только вопрос, но и весь контекст, который вы ей отправляете. По мере увеличения контекста растет и количество входных токенов.

Aether Compress размещается между вашим приложением и моделью. Сначала он оптимизирует контекст и создает более компактный контекст. Следующий шаг полностью контролируется вами.

Размещение
01
Ваше приложение
Создается контекст
02
Aether Compress
Контекст оптимизируется
03
Ваш текущий поток LLM
Используется оптимизированный контекст
ИзменяющийсяContext
НеизменяемыйАрхитектура модели
Экономия контекста

Часть стоимости моделивозникает из нагрузки, которую вы отправляете модели.

Больший контекст не всегда означает больше полезной информации. Повторы, вспомогательный контент и части с низкой связью с запросом также передаются модели как токены ввода.

01
Стоимость токенов

По мере увеличения контекста возрастает количество токенов, отправляемых поставщику и взимаемых за это.

02
Поле контекста

Ненужное содержимое потребляет поле контекста, которое может быть использовано для действительно необходимых данных.

03
Масштаб

Разница, кажущаяся небольшой в одном запросе, при высоком объеме вызовов превращается в большое общее количество токенов.

Как это работает?

Ввод контекста.Вывод оптимизированного контекста.

Aether Compress, модель не пытается генерировать ответ. Его задача - сделать входной контекст более эффективным до того, как он достигнет LLM.

01
Отправьте контекст

Вы отправляете текущий контекст вашего приложения в API Aether.

02
Режим определяется

Если запроса нет — применяется общая оптимизация, если запрос есть — применяется оптимизация, ориентированная на запрос.

03
Контекст оптимизируется

Aether определяет нагрузку, которую можно уменьшить, сохраняя доступную информацию.

04
Получите результат

Оптимизированный контекст напрямую возвращается в ваше приложение.

Режимы оптимизации

Независимо от наличия запроса.

Вы можете использовать два разных способа оптимизации в зависимости от того, как будет использоваться контекст.

Режим 01
General

Общий контекстоптимизируйте с сохранением.

Если вы хотите оптимизировать контекст без конкретного вопроса пользователя, вы можете использовать режим General.

Память разговоровСостояние агентаОбщий контекст
Режим 02
Query-Aware

Context'iсосредоточьтесь на запросе.

Если вопрос пользователя известен, его также можно включить в запрос об оптимизации. Таким образом, контекст Aether обрабатывается с учётом информационной потребности этого запроса.

RAGДокумент Q&AСлужба поддержки клиентов
В чем разница?

Другая модельeklemiyoruz.

Создание нового вызова LLM для уменьшения затрат на контекст может означать просто перенос этих затрат в другое место. Aether Compress не основывает свой процесс оптимизации на отдельном вызове LLM.

Оптимизация без LLM

Aether Compress не отправляет запрос другому искусственному интеллекту для оптимизации контекста.

Независимый от поставщика

Оптимизированный контекст можно использовать на следующем этапе с любой предпочитаемой моделью или поставщиком.

Перед текущим потоком

Вам не нужно менять вашу модель, архитектуру подсказок или основной LLM-слой вашего приложения.

Измеримый результат

Вы можете измерить результат, сравнив количество оригинальных и оптимизированных токенов для каждого запроса.

API-поток

Получите только контекст.Если хотите, продолжайте до ответа.

Aether Compress — это слой оптимизации продукта. Aether Generate — это необязательный способ использования, который объединяет этот слой с вашим AI-провайдером в один вызов.

Aether Compress
Только оптимизация
Вызова AI нет
INPUTcontext
AETHERcompress
OUTPUTdata.compressed

Оптимизированный контекст возвращается непосредственно в ваше приложение. Вы сами определяете, с какой моделью, когда и как его использовать.

Aether Generate
Оптимизировать + Создать
BYOK
INPUTcontext
AETHERcompress
PROVIDERyour_llm
OUTPUTresponse

Context сначала оптимизируется, затем отправляется на модель через вашу собственную учетную запись провайдера, и окончательный ответ возвращается в одном потоке.

Entegrasyon

С одним вызовом APIдобавьте в ваш поток.

Достаточно вставить Aether Compress между вашей текущей стадией создания context и вашим вызовом LLM.

Просмотрите документацию
POST /v1/compress
const response = await fetch(
  "https://api.aether.tr/v1/compress",
  {
    method: "POST",
    headers: {
      "Authorization": "Bearer YOUR_API_KEY",
      "Idempotency-Key": crypto.randomUUID(),
      "Content-Type": "application/json"
    },
    body: JSON.stringify({
      context,
      query
    })
  }
);

const result = await response.json();

console.log(result.context);
Before12,840
After7,620
Сферы применения

Если context увеличивается,может быть область для оптимизации.

Aether сосредоточен на структуре context, отправляемой LLM, вместо конкретной отрасли.

AI Ассистенты

Оптимизируйте длинную историю разговоров и повторяющийся контекст перед вызовом модели.

RAG Системы

Сделайте более эффективными части документов, полученные в результате поиска, в соответствии с запросом пользователя.

AI Агент

Уменьшите нагрузку на выводы инструментов, историю задач и накопленный контекст агента.

Анализ документов

Не переносите полностью длинные отчёты, контракты и корпоративные документы при каждом запросе.

Служба поддержки клиентов

Оптимизируйте историю разговоров, информацию о клиентах и контекст центра поддержки.

Код и технический контент

Сократите большие контексты, содержащие исходный код, логи, вывод ошибок и техническую документацию.

Проверка

Не только меньше.Информация также должна быть сохранена.

При оценке Aether Compress мы измеряем не только сокращение токенов. Мы также отдельно проверяем, сохраняет ли оптимизированный контекст необходимую информацию.

Просмотрите результаты бенчмарка
100.000
локальный сценарий проверки
40,65%
среднее уменьшение входных данных
500 / 500
внешняя проверка модели
52,67%
измеренное максимальное сокращение
Примечание к измерению: Значение 40,65% является средним уменьшением входных данных на проверочном наборе из 100 000 сценариев. Реальный результат зависит от структуры контекста. Значение 3,48 мс — это среднее время обработки, измеренное в проверочной среде.
Контроль за вами

Если безопасного уменьшения нетне обязательно уменьшать.

Цель не в том, чтобы при любых условиях получать меньший выход. Более важно сохранять используемую информацию, чем уменьшать контекст, который нужно сохранить.

Измеряйте

Не по среднему значению маркетинга,смотрите на свой собственный контекст.

Структура контекста у каждого приложения разная. Самый точный способ увидеть реальную ценность Aether — измерять её на собственных продуктивных данных.

Когда это имеет смысл?

Если стоимость контекста действительно имеет значение.

Длинный контекст

Если ваши запросы несут историю переписки, документы или контекст большой системы.

Высокий объём вызовов

В системах, где одна и та же оптимизация повторяется тысячами или миллионами запросов.

Очень короткий запрос

Если ввод уже на уровне нескольких токенов, область для сокращения естественно ограничена.

Уже минимальный контекст

Если ваш контекст ранее был агрессивно минимизирован, дополнительная выгода может быть ниже.

Aether Compress

Отправьте ваш контекст.Увидьте разницу на ваших собственных данных.

Тестируйте Aether Compress с 1 миллионом бесплатных токенов на реальных данных, похожих на ваш production context.

Кредитная карта не требуется
1 млн бесплатных токенов