menos a LLMEnviar contexto.
Aether Compress optimiza su contexto antes de la llamada al modelo, reduce la carga de tokens de entrada innecesaria, conserva la información utilizable y permite que su flujo de AI actual funcione de manera más eficiente.
trabajando antes del modelouna capa de optimización del contexto.
En una convocatoria de LLM, el modelo no solo hace la pregunta, sino que también Procesa todo el contexto que envías. este contexto A medida que crece, la cantidad de tokens de entrada también aumenta.
Aether Compress, se coloca entre su aplicación y el modelo. Primero optimiza el Contexto y genera un contexto más pequeño. El siguiente paso está completamente bajo su control.
Parte del costo del modelo.Proviene de la carga útil que envías al modelo.
Un mayor contexto siempre significa más información útil. No viene. Repeticiones, contenido auxiliar y baja relevancia para la consulta Las secciones también se transfieren al modelo como tokens de entrada.
A medida que crece el contexto de entrada, aumenta la cantidad de tokens enviados y cobrados al proveedor.
El contenido innecesario consume espacio contextual que la información verdaderamente necesaria podría utilizar.
Lo que puede parecer una pequeña diferencia en una sola solicitud se convierte en grandes cantidades totales de tokens con un alto volumen de llamadas.
Entra el contexto.Aparece el contexto optimizado.
Aether Compress no intenta generar una respuesta del modelo. Su tarea es hacer que el contexto de entrada sea más eficiente antes de llegar al LLM.
Envía el contexto existente en su aplicación a la API de Aether.
Si no hay consulta, se aplica la optimización general, y si hay una consulta, se aplica la optimización orientada a consultas.
Aether determina la carga que se puede reducir conservando la información disponible.
El contexto optimizado regresa directamente a su aplicación.
Consulta o no.
Hay dos formas diferentes de utilizar el contexto. Puede utilizar el formato de optimización.
Contexto generalOptimizar y proteger.
contexto sin una pregunta de usuario específica Modo general cuando quieres optimizar puedes usar
Context'iCentrarse en la consulta.
Si se conoce la pregunta del usuario, la consulta también puede añadirse a la solicitud de optimización. De esta manera, Aether procesa el contexto teniendo en cuenta la necesidad de información de esa consulta.
otro modeloeklemiyoruz.
Hacer una nueva llamada a un LLM para reducir el costo del contexto puede significar trasladar el costo a otro lugar. Aether Compress no basa su proceso de optimización en una llamada separada a un LLM.
Aether Compress no envía solicitudes a otro modelo de inteligencia artificial para optimizar el contexto.
El contexto optimizado se puede utilizar en la siguiente etapa con el modelo o proveedor que prefiera.
No es necesario cambiar el modelo, la arquitectura del mensaje ni la capa principal de LLM de su aplicación.
Puede medir el resultado comparando la cantidad de tokens originales y optimizados en cada solicitud.
Solo entiende el contexto.Continúa hasta la respuesta si quieres.
Aether Compress es la capa de optimización del producto. Aether Generate, por su parte, es una forma de uso opcional que combina esta capa en una sola llamada con su proveedor de IA.
El contexto optimizado regresa directamente a su aplicación. Tú decides qué modelo, cuándo y cómo utilizarlo. Tú determinas.
Primero se optimiza el contexto y luego su propio proveedor. se envía al modelo a través de su cuenta y la respuesta final gira en un solo flujo.
Con una única llamada APIagrégalo a tu flujo.
Solo es necesario agregar Aether Compress entre la etapa de creación de contexto existente y su llamada al LLM.
Revisar la documentaciónconst response = await fetch(
"https://api.aether.tr/v1/compress",
{
method: "POST",
headers: {
"Authorization": "Bearer YOUR_API_KEY",
"Idempotency-Key": crypto.randomUUID(),
"Content-Type": "application/json"
},
body: JSON.stringify({
context,
query
})
}
);
const result = await response.json();
console.log(result.context);Si el contexto está creciendo,Podría ser un área de optimización.
Aether se centra en la estructura de contexto enviada al LLM en lugar de en un sector específico.
Optimice los historiales de conversaciones largos y el contexto repetitivo antes de llamar al modelo.
Hacer que los fragmentos de documentos que surgen como resultado de la recuperación sean más eficientes según la consulta del usuario.
Reduzca la carga de los resultados de las herramientas, el historial de tareas y el contexto acumulado del agente.
No lleve largos informes, contratos y documentos corporativos en su totalidad con cada solicitud.
Optimice el historial de conversaciones, la información del cliente y el contexto del centro de ayuda.
Minimice contextos grandes que contengan código fuente, registros, resultados de errores y documentación técnica.
No sólo más pequeño.La información también debe protegerse.
Al evaluar Aether Compress, no solo medimos la reducción de tokens. También verificamos por separado que el contexto optimizado conserve la información necesaria.
Consulte los resultados de las pruebas comparativasSi no hay una reducción seguraNo tiene por qué reducirse.
El objetivo no es producir una producción menor en todas las circunstancias. Más importante que reducir el contexto que debe preservarse, protección de la información utilizable.
No es el promedio de marketing,Mire su propio contexto.
La estructura de contexto de cada aplicación es diferente. La forma más precisa de ver el valor real de Aether es medirlo con tus propios datos de producción.
Si el costo del contexto realmente existe.
Si sus solicitudes contienen historial de conversaciones, documentos o contexto de sistema grande.
En sistemas donde la misma optimización se repite en miles o millones de solicitudes.
Si la entrada ya está al nivel de unas pocas fichas, el espacio que se puede reducir es naturalmente limitado.
Si su contexto ha sido minimizado agresivamente antes, la ganancia adicional puede ser menor.
Envíe su contexto.Vea la diferencia en sus propios datos.
Prueba Aether Compress con 1 millón de tokens gratuitos utilizando datos reales similares al contexto de tu producción.
