AETHER · Aether Compress

menos a LLMEnviar contexto.

Aether Compress optimiza su contexto antes de la llamada al modelo, reduce la carga de tokens de entrada innecesaria, conserva la información utilizable y permite que su flujo de AI actual funcione de manera más eficiente.

No se requiere tarjeta de crédito
1 millón de fichas gratis
Aether Compress
Optimización del contexto
Ready
Contexto de entrada12.840 fichas
Optimize
Contexto optimizado7.620 fichas
-40,65%
ortalama
3,48 ms
promedio medido
100%
resultado de la prueba
Sin convocatoria de LLM·No se requiere GPU·Contexto dentro / contexto fuera
40,65%
reducción promedio de insumos
100K+
escenario de verificación
100%
precisión de respuesta medida
3,48 ms
tiempo promedio de procesamiento
¿Qué es Aether Compress?

trabajando antes del modelouna capa de optimización del contexto.

En una convocatoria de LLM, el modelo no solo hace la pregunta, sino que también Procesa todo el contexto que envías. este contexto A medida que crece, la cantidad de tokens de entrada también aumenta.

Aether Compress, se coloca entre su aplicación y el modelo. Primero optimiza el Contexto y genera un contexto más pequeño. El siguiente paso está completamente bajo su control.

liquidación
01
Tu aplicación
El contexto ocurre
02
Aether Compress
El contexto está optimizado.
03
Su corriente actual de LLM
Se utiliza contexto optimizado.
cambiandoContext
inmutableTu modelo de arquitectura
Economía de contexto

Parte del costo del modelo.Proviene de la carga útil que envías al modelo.

Un mayor contexto siempre significa más información útil. No viene. Repeticiones, contenido auxiliar y baja relevancia para la consulta Las secciones también se transfieren al modelo como tokens de entrada.

01
Costo del token

A medida que crece el contexto de entrada, aumenta la cantidad de tokens enviados y cobrados al proveedor.

02
Área de contexto

El contenido innecesario consume espacio contextual que la información verdaderamente necesaria podría utilizar.

03
escala

Lo que puede parecer una pequeña diferencia en una sola solicitud se convierte en grandes cantidades totales de tokens con un alto volumen de llamadas.

¿Cómo funciona?

Entra el contexto.Aparece el contexto optimizado.

Aether Compress no intenta generar una respuesta del modelo. Su tarea es hacer que el contexto de entrada sea más eficiente antes de llegar al LLM.

01
Enviar contexto

Envía el contexto existente en su aplicación a la API de Aether.

02
El modo está determinado.

Si no hay consulta, se aplica la optimización general, y si hay una consulta, se aplica la optimización orientada a consultas.

03
El contexto está optimizado.

Aether determina la carga que se puede reducir conservando la información disponible.

04
obtener el resultado

El contexto optimizado regresa directamente a su aplicación.

Modos de optimización

Consulta o no.

Hay dos formas diferentes de utilizar el contexto. Puede utilizar el formato de optimización.

modo 01
General

Contexto generalOptimizar y proteger.

contexto sin una pregunta de usuario específica Modo general cuando quieres optimizar puedes usar

Memoria de conversaciónEstado del agenteContexto general
Modo 02
Query-Aware

Context'iCentrarse en la consulta.

Si se conoce la pregunta del usuario, la consulta también puede añadirse a la solicitud de optimización. De esta manera, Aether procesa el contexto teniendo en cuenta la necesidad de información de esa consulta.

RAGPreguntas y respuestas sobre el documentoAtención al cliente
¿Cuál es la diferencia?

otro modeloeklemiyoruz.

Hacer una nueva llamada a un LLM para reducir el costo del contexto puede significar trasladar el costo a otro lugar. Aether Compress no basa su proceso de optimización en una llamada separada a un LLM.

Optimización sin LLM

Aether Compress no envía solicitudes a otro modelo de inteligencia artificial para optimizar el contexto.

Proveedor independiente

El contexto optimizado se puede utilizar en la siguiente etapa con el modelo o proveedor que prefiera.

Adelantándose al flujo actual

No es necesario cambiar el modelo, la arquitectura del mensaje ni la capa principal de LLM de su aplicación.

Resultado medible

Puede medir el resultado comparando la cantidad de tokens originales y optimizados en cada solicitud.

Flujo API

Solo entiende el contexto.Continúa hasta la respuesta si quieres.

Aether Compress es la capa de optimización del producto. Aether Generate, por su parte, es una forma de uso opcional que combina esta capa en una sola llamada con su proveedor de IA.

Aether Compress
Optimizar solo
Sin llamada de IA
INPUTcontext
AETHERcompress
OUTPUTdata.compressed

El contexto optimizado regresa directamente a su aplicación. Tú decides qué modelo, cuándo y cómo utilizarlo. Tú determinas.

Aether Generate
Optimizar + Generar
BYOK
INPUTcontext
AETHERcompress
PROVIDERyour_llm
OUTPUTresponse

Primero se optimiza el contexto y luego su propio proveedor. se envía al modelo a través de su cuenta y la respuesta final gira en un solo flujo.

Entegrasyon

Con una única llamada APIagrégalo a tu flujo.

Solo es necesario agregar Aether Compress entre la etapa de creación de contexto existente y su llamada al LLM.

Revisar la documentación
POST /v1/compress
const response = await fetch(
  "https://api.aether.tr/v1/compress",
  {
    method: "POST",
    headers: {
      "Authorization": "Bearer YOUR_API_KEY",
      "Idempotency-Key": crypto.randomUUID(),
      "Content-Type": "application/json"
    },
    body: JSON.stringify({
      context,
      query
    })
  }
);

const result = await response.json();

console.log(result.context);
Before12,840
After7,620
Áreas de uso

Si el contexto está creciendo,Podría ser un área de optimización.

Aether se centra en la estructura de contexto enviada al LLM en lugar de en un sector específico.

Asistentes de IA

Optimice los historiales de conversaciones largos y el contexto repetitivo antes de llamar al modelo.

Sistemas RAG

Hacer que los fragmentos de documentos que surgen como resultado de la recuperación sean más eficientes según la consulta del usuario.

Agente de IA

Reduzca la carga de los resultados de las herramientas, el historial de tareas y el contexto acumulado del agente.

Análisis de documentos

No lleve largos informes, contratos y documentos corporativos en su totalidad con cada solicitud.

Atención al cliente

Optimice el historial de conversaciones, la información del cliente y el contexto del centro de ayuda.

Código y contenido técnico

Minimice contextos grandes que contengan código fuente, registros, resultados de errores y documentación técnica.

verificación

No sólo más pequeño.La información también debe protegerse.

Al evaluar Aether Compress, no solo medimos la reducción de tokens. También verificamos por separado que el contexto optimizado conserve la información necesaria.

Consulte los resultados de las pruebas comparativas
100.000
escenario de autenticación local
40,65%
reducción promedio de insumos
500 / 500
verificación de modelo externo
52,67%
reducción máxima medida
Nota de medición: El valor de 40,65% es el promedio de un conjunto de validación de 100.000 escenarios. Es una reducción de insumos. El resultado real varía según la estructura del contexto. El valor de 3,48 ms es el tiempo de procesamiento promedio medido en el entorno de validación.
Tu estas en control

Si no hay una reducción seguraNo tiene por qué reducirse.

El objetivo no es producir una producción menor en todas las circunstancias. Más importante que reducir el contexto que debe preservarse, protección de la información utilizable.

Medida

No es el promedio de marketing,Mire su propio contexto.

La estructura de contexto de cada aplicación es diferente. La forma más precisa de ver el valor real de Aether es medirlo con tus propios datos de producción.

¿Cuándo tiene sentido?

Si el costo del contexto realmente existe.

Contexto largo

Si sus solicitudes contienen historial de conversaciones, documentos o contexto de sistema grande.

Alto volumen de llamadas

En sistemas donde la misma optimización se repite en miles o millones de solicitudes.

Mensaje muy corto

Si la entrada ya está al nivel de unas pocas fichas, el espacio que se puede reducir es naturalmente limitado.

Contexto ya mínimo

Si su contexto ha sido minimizado agresivamente antes, la ganancia adicional puede ser menor.

Aether Compress

Envíe su contexto.Vea la diferencia en sus propios datos.

Prueba Aether Compress con 1 millón de tokens gratuitos utilizando datos reales similares al contexto de tu producción.

No se requiere tarjeta de crédito
1 millón de fichas gratis