Отправляйте LLM меньшеконтента.
Aether Compress оптимизирует ваш контекст перед вызовом модели. Снижает ненужную нагрузку токенов ввода, сохраняет доступную информацию и обеспечивает более эффективную работу вашего текущего AI-потока.
Работает перед модельюСлой оптимизации контекста.
При вызове LLM модель обрабатывает не только вопрос, но и весь контекст, который вы ей отправляете. По мере увеличения контекста растет и количество входных токенов.
Aether Compress размещается между вашим приложением и моделью. Сначала он оптимизирует контекст и создает более компактный контекст. Следующий шаг полностью контролируется вами.
Часть стоимости моделивозникает из нагрузки, которую вы отправляете модели.
Больший контекст не всегда означает больше полезной информации. Повторы, вспомогательный контент и части с низкой связью с запросом также передаются модели как токены ввода.
По мере увеличения контекста возрастает количество токенов, отправляемых поставщику и взимаемых за это.
Ненужное содержимое потребляет поле контекста, которое может быть использовано для действительно необходимых данных.
Разница, кажущаяся небольшой в одном запросе, при высоком объеме вызовов превращается в большое общее количество токенов.
Ввод контекста.Вывод оптимизированного контекста.
Aether Compress, модель не пытается генерировать ответ. Его задача - сделать входной контекст более эффективным до того, как он достигнет LLM.
Вы отправляете текущий контекст вашего приложения в API Aether.
Если запроса нет — применяется общая оптимизация, если запрос есть — применяется оптимизация, ориентированная на запрос.
Aether определяет нагрузку, которую можно уменьшить, сохраняя доступную информацию.
Оптимизированный контекст напрямую возвращается в ваше приложение.
Независимо от наличия запроса.
Вы можете использовать два разных способа оптимизации в зависимости от того, как будет использоваться контекст.
Общий контекстоптимизируйте с сохранением.
Если вы хотите оптимизировать контекст без конкретного вопроса пользователя, вы можете использовать режим General.
Context'iсосредоточьтесь на запросе.
Если вопрос пользователя известен, его также можно включить в запрос об оптимизации. Таким образом, контекст Aether обрабатывается с учётом информационной потребности этого запроса.
Другая модельeklemiyoruz.
Создание нового вызова LLM для уменьшения затрат на контекст может означать просто перенос этих затрат в другое место. Aether Compress не основывает свой процесс оптимизации на отдельном вызове LLM.
Aether Compress не отправляет запрос другому искусственному интеллекту для оптимизации контекста.
Оптимизированный контекст можно использовать на следующем этапе с любой предпочитаемой моделью или поставщиком.
Вам не нужно менять вашу модель, архитектуру подсказок или основной LLM-слой вашего приложения.
Вы можете измерить результат, сравнив количество оригинальных и оптимизированных токенов для каждого запроса.
Получите только контекст.Если хотите, продолжайте до ответа.
Aether Compress — это слой оптимизации продукта. Aether Generate — это необязательный способ использования, который объединяет этот слой с вашим AI-провайдером в один вызов.
Оптимизированный контекст возвращается непосредственно в ваше приложение. Вы сами определяете, с какой моделью, когда и как его использовать.
Context сначала оптимизируется, затем отправляется на модель через вашу собственную учетную запись провайдера, и окончательный ответ возвращается в одном потоке.
С одним вызовом APIдобавьте в ваш поток.
Достаточно вставить Aether Compress между вашей текущей стадией создания context и вашим вызовом LLM.
Просмотрите документациюconst response = await fetch(
"https://api.aether.tr/v1/compress",
{
method: "POST",
headers: {
"Authorization": "Bearer YOUR_API_KEY",
"Idempotency-Key": crypto.randomUUID(),
"Content-Type": "application/json"
},
body: JSON.stringify({
context,
query
})
}
);
const result = await response.json();
console.log(result.context);Если context увеличивается,может быть область для оптимизации.
Aether сосредоточен на структуре context, отправляемой LLM, вместо конкретной отрасли.
Оптимизируйте длинную историю разговоров и повторяющийся контекст перед вызовом модели.
Сделайте более эффективными части документов, полученные в результате поиска, в соответствии с запросом пользователя.
Уменьшите нагрузку на выводы инструментов, историю задач и накопленный контекст агента.
Не переносите полностью длинные отчёты, контракты и корпоративные документы при каждом запросе.
Оптимизируйте историю разговоров, информацию о клиентах и контекст центра поддержки.
Сократите большие контексты, содержащие исходный код, логи, вывод ошибок и техническую документацию.
Не только меньше.Информация также должна быть сохранена.
При оценке Aether Compress мы измеряем не только сокращение токенов. Мы также отдельно проверяем, сохраняет ли оптимизированный контекст необходимую информацию.
Просмотрите результаты бенчмаркаЕсли безопасного уменьшения нетне обязательно уменьшать.
Цель не в том, чтобы при любых условиях получать меньший выход. Более важно сохранять используемую информацию, чем уменьшать контекст, который нужно сохранить.
Не по среднему значению маркетинга,смотрите на свой собственный контекст.
Структура контекста у каждого приложения разная. Самый точный способ увидеть реальную ценность Aether — измерять её на собственных продуктивных данных.
Если стоимость контекста действительно имеет значение.
Если ваши запросы несут историю переписки, документы или контекст большой системы.
В системах, где одна и та же оптимизация повторяется тысячами или миллионами запросов.
Если ввод уже на уровне нескольких токенов, область для сокращения естественно ограничена.
Если ваш контекст ранее был агрессивно минимизирован, дополнительная выгода может быть ниже.
Отправьте ваш контекст.Увидьте разницу на ваших собственных данных.
Тестируйте Aether Compress с 1 миллионом бесплатных токенов на реальных данных, похожих на ваш production context.
