可观测性
数据统计与预警
每个请求产生一条记录。记录可在面板中查询,也可通过 OpenTelemetry 导出。
记录字段
- 请求
- 按 provider、模型、密钥、工作区
- Token
- 输入、输出、命中缓存
- 延迟
- p50、p95、p99、首 Token 时间
- 成本
- 按请求、按模型、按团队
- 错误
- 按失败分类与上游状态码
- 健康度
- 按目标,滑动窗口
统计面板(示例)
最近 24 小时- 请求数
- 1,284,930
- 错误率
- 0.31%
- p99 延迟
- 1.42s
- 成本
- $2,418
+4.1%
-0.12%
+0.04s
+2.8%
延迟分布
p50p95p99
| 目标 | 流量占比 | 错误率 | 状态 |
|---|---|---|---|
| openai / gpt-6-sol | 52% | 0.18% | 服务中 |
| anthropic / claude-sonnet-5-5 | 31% | 0.24% | 服务中 |
| bedrock / claude-opus-5-5 | 14% | 1.10% | 降级 |
| azure / gpt-6-astra | 3% | — | 已暂停 |
示例数据,用于展示布局
在触达上限之前触发
告警规则读取的是面板同一批计数,图表上看到的即为触发所依据的数值。
导出方式
OpenTelemetry(OTLP)、Prometheus 抓取、结构化 JSON 日志,以及 Webhook。
配额余量
按当前消耗速率推算密钥或账号何时触达上限,而不是等总量接近阈值才提醒。
错误率
按目标、按失败分类,在可配置的窗口内持续超过阈值时触发。
延迟
p99 相对目标自身基线或同类目标出现回退时触发。
健康状态变化
目标被暂停轮转或恢复进入轮转时触发。