Aether
AETHER · 基准测试与验证

更少的令牌。测量结果。

我们不仅通过缩小的程度来衡量Aether Compress, 还衡量其在缩小过程中保留必要信息的能力。 我们的结果通过大规模本地测试和独立模型验证进行评估。

40,65%
平均输入减少
100K+
测试场景
100%
信息保留效果
3.48毫秒
平均处理时间
验证架构

两个不同的测试层。

本地验证测试信息丢失情况的广泛程度。 外部模型验证则衡量从优化后的上下文生成的回答是否包含与原始上下文相同的信息。

层 01
本地验证
100.000
测试场景
100%
成功
40,65%
平均减小
52,67%
测量最大值
3.48毫秒
平均时间
第02层
外部模型验证
500 / 500
已验证的场景
100%
测量的响应准确性
25,13%
在所选集合中的减小
500
已完成的测试
0
失败测试
为什么比率不同? 40.65% 是 100,000 个场景的本地验证集合的平均值。25.13% 是为外部模型验证而选择的 500 个场景的独立子集的测量值。两个值并不代表相同的测试组。
输入减少

Ortalama减少 40.65%

测量值显示优化输入相对于原始输入在令牌数量上的平均减少。

原始输入
100%
Aether 之后
59,35%
Normal
已优化
减少量%40,65
测量 01
更小本身并不是成功。

在评估 Aether Compress 时,不仅测量令牌减少量。优化后的上下文保持必要信息是主要成功条件。

测量 02
最终答案也会被验证。

在外部验证层中,相同的问题会通过原始和优化的上下文进行评估,并衡量答案是否保留了所需的信息。

Kapsam

我们不根据单一内容类型进行衡量。

测试集由具有不同密度、结构和上下文特征的场景组成。

01
直接信息
02
多重信息
03
长上下文
04
查询导向
05
结构化内容
06
技术内容
07
代码上下文
08
混合内容
09
重复内容
10
低冗余
11
高冗余
12
边界情况
Metodoloji

相同的衡量是一个可重复的过程。

基准测试过程会分别衡量原始输入、优化输入和验证结果。

01
Orijinal

测试输入保持不变作为参考。

02
Optimize

相同的输入通过 Aether Compress 处理。

03
比较

Token 减少和信息保留分别进行测量。

04
验证

除所选测试外,将在其他模型上单独检查。

在读取结果时

测量界限

40.65% 不是保证值

减少率根据输入的结构和包含的多余信息量而变化。

3.48 毫秒不是通用延迟

这是在验证环境中测量的平均处理时间。可能会因硬件和工作负载而有所不同。

52.67% 是最大测量值

此数值显示了在验证集上观察到的最大减少,并非每个请求的预期比例。

准确性已被测量

外部验证中的100%值是对测试的500个场景的结果,并不意味着对所有可能的输入都有保证。

用您自己的数据进行测量

比基准测试更重要的是,是您的输入。

免费试用Aether Compress,看看在您自己的真实场景中能减少多少token。

免费试用
无需信用卡
100万免费令牌