AETHER · Сценарии использования

Контекст увеличивается.Нагрузка не обязательно должна увеличиваться.

От AI-ассистентов до систем RAG, от рабочих процессов агентств до анализа документов, Aether Compress может быть адаптирован под различные сценарии использования, где можно уменьшить лишнюю нагрузку входных данных, отправляемых в LLM.

Общая проблема

Приложения разные.Проблема контекста та же.

По мере роста приложений ИИ увеличивается информация, отправляемая в модель. История разговоров, результаты поиска, выводы инструментов, документы и системные инструкции становятся частью входных данных при каждом новом запросе.

Aether создает отдельный слой, где эта нагрузка может быть оптимизирована до того, как дойдет до LLM.

Поток контекста
01
Uygulama
Создается контекст
02
Aether Compress
Входные данные оптимизируются
03
LLM
Отправляется меньший контекст
EntegrasyonПеред существующим потоком
Где используется?

Везде, где используется контекстможет быть область для оптимизации.

Область применения больше зависит от структуры входных данных, отправляемых LLM, чем от отрасли.

01 · AI Ассистенты
Сжать + Генерировать

Делайте длинные разговоры легче.

По мере роста AI-ассистентов история разговоров, системные инструкции и дополнительный контекст могут снова передаваться при каждом запросе. Aether Compress помогает уменьшить нагрузку на ввод, оптимизируя контекст, отправляемый модели.

Длинная история разговоровСистемный и пользовательский контекстПовторяющаяся информация сеанса
02 · RAG Системы
Ориентировано на запрос

Вам не обязательно переносить весь полученный контекст.

Слой извлечения может вернуть множество фрагментов документов для одного запроса. Aether помогает оптимизировать полученный контекст до вызова LLM, создавая более маленький ввод.

Извлечённые фрагментыБазы знанийВопрос-ответ на основе документов
03 · Служба поддержки клиентов
Сжать + Генерировать

Не отправляйте один и тот же объём данных при каждом запросе в службу поддержки.

Службы поддержки; могут переносить историю клиента, документацию по продукту, предыдущие сообщения и правила поддержки в одном запросе. Aether обеспечивает оптимизацию этого контекста до использования LLM.

Разговоры поддержкиИстория клиентаСодержимое центра помощи
04 · AI Агент
Compress

По мере роста агента контекст не обязательно должен расти.

В системах агента результаты инструментов, история задач и промежуточные шаги могут быстро накапливаться в контексте. Aether может использоваться для снижения объема переносимых данных до следующего вызова модели.

Вывод инструментовИстория задачМногоступенчатые рабочие процессы
05 · Код и технический контент
Compress

Отправляйте более эффективный большой технический контекст.

Помощники по коду и технические AI-инструменты могут переносить исходный код, журналы ошибок, конфигурации и документацию в одном контексте. Aether может оптимизировать этот ввод перед вызовом модели.

Контекст исходного кодаЖурналы и вывод ошибокТехническая документация
06 · Анализ документов
Ориентировано на запрос

Не переносите длинные документы заново в каждом вопросе.

В AI-приложениях, работающих с отчетами, контрактами, руководствами и корпоративными документами, необходимый контекст можно оптимизировать в зависимости от запроса, отправляя модели меньший ввод.

Отчеты и контрактыКорпоративные документыАнализ длинного текста
Два подхода к оптимизации

В зависимости от контекста.В зависимости от запроса.

Общая оптимизация
Без запросаОптимизация контекста.

Можно использовать в потоках, где вы хотите оптимизировать содержание без привязки к конкретному вопросу. Примерами являются системы с историей разговоров, состоянием агента или общим контекстом.

AI АссистентAgentТехнический контекст
Ориентировано на запрос
Если вопрос известенТакже используйте фокус.

Если запрос пользователя известен заранее, Aether может включить запрос в процесс оптимизации, обрабатывая контекст с фокусом на этот запрос.

RAGДокумент Q&ADestek
Пример · RAG

После завершения извлеченияможет начаться оптимизация.

Aether не заменяет систему извлечения. Он добавляется между результатом извлечения и вызовом LLM.

01
Запрос пользователя

Приложение получает вопрос.

02
Retrieval

Ваша текущая инфраструктура RAG извлекает соответствующие фрагменты документов.

03
Aether Compress

Извлечённый контекст оптимизируется с учётом запроса пользователя.

04
LLM

Оптимизированный контекст отправляется вашему текущему поставщику модели.

Высокий объем
Небольшая экономиярастет с объемом.

Разница в токенах в одном запросе может казаться незначительной. Когда та же оптимизация повторяется тысячами или миллионами вызовов LLM, разница в общем объеме входных данных растет.

Текущая архитектура
Modeliniziне обязательно менять.

Aether не является выбором модели. Так как она работает на этапе подготовки контекста, её можно добавить без изменения вашего текущего AI-потока.

Независимо от отрасли

Если проблема в токенах,сектор вторичен.

Aether не является слоем оптимизации, разработанным по терминологии конкретного сектора. Поэтому одна и та же архитектура может использоваться в разных AI-приложениях.

SaaS

Программные продукты, использующие функции AI.

E-ticaret

Продукт, поддержка и помощники для покупок.

Finans

AI-приложения на основе документов и базы знаний.

Hukuk

Анализ длинных документов и контрактов.

Kurumsal

Внутренние базы знаний и помощники для сотрудников.

Инструменты для разработчиков

Приложения, использующие код, логи и технический контекст.

Два способа использования

Получите контекст.Или получите ответ.

Вариант 01
Aether Compress
Только оптимизация

Оптимизированный контекст напрямую возвращается в ваше приложение. Следующий вызов LLM выполняется вашей текущей инфраструктурой самостоятельно.

POST /v1/compress
Вариант 02
Aether Generate
Один поток

Сначала контекст оптимизируется с помощью Aether Compress, затем отправляется выбранному вами поставщику ИИ, и окончательный ответ возвращается в ваше приложение.

Сжатие → Поставщик → Ответ
Правильное использование

Не каждую заявку нужно сжимать.

Очень короткие входные данные

Если контекст уже очень маленький, ненужная нагрузка на оптимизацию может быть ограниченной.

Низкий объем повторений

В приложениях, которые вызывают LLM очень редко, общий экономический эффект, естественно, может быть ниже.

Уже минимальный контекст

Если ввод уже был интенсивно оптимизирован, дополнительное снижение может быть ограничено.

Сначала измерьте

Наиболее точное решение достигается путем тестирования Aether на ваших реальных входных данных.

Ваш собственный сценарий

Лучший вариант использованияваши реальные данные.

Попробуйте Aether Compress на вашем собственном контексте и измерьте, сколько места занимает ваш ввод.

Попробуйте бесплатно
Кредитная карта не требуется
1М бесплатных токенов