观测与运营 · AI 评估
eval_support_v12
480 条生产样本
从标准定义到版本决策,评估结果直接服务路由与上线策略。
按业务场景建立正确性、安全性、相关性和成本指标。
在同一批样本上比较模型、Prompt、RAG 与 Agent 版本。
将评测结论用于模型准入、灰度、路由权重和回滚判断。
通过版本、样本和指标留存,让模型升级、Prompt 修改和路由调整不再依赖主观体验。
继续了解与AI 评估直接相关的 Gateway 能力。
从应用请求追踪到路由、策略和上游响应。
管理 Agent 的身份、工具调用、预算和运行结果。