检测回答的是什么问题
当一个渠道声称提供某个模型时,调用方通常关心接口是否可用、响应是否符合协议、模型名是否如实回显,以及关键能力是否按预期工作。检测会围绕这些可观察行为建立证据。
这适用于 OpenAI 或 Anthropic 兼容 API。对于不同模型,系统会先识别协议,再仅执行适用的项目;明确不适用的能力不进入评分。
证据从哪里来
协议与响应结构
系统检查端点是否可访问,响应的 ID、内容、错误对象与用量字段是否具备该协议的基本结构,同时观察响应头等实现特征。
声明模型与行为
系统比对接口回显的模型名称与填写的声明模型,并用流式响应、输出控制、多轮上下文、系统指令、工具调用和多模态输入等项目验证接口实际暴露的能力。
重复调用与用量
在适用时,系统比较重复请求的响应形态,检查异常固定响应或重放迹象,并核验 usage 等用量信息是否与响应内容大致一致。
重要:单个异常不等于底层模型被替换。网络抖动、限流、模型版本升级、路由策略与渠道侧缓存都可能影响一次调用的结果。
如何判定结果
检测结果会综合必检项、加权得分、有效证据覆盖率与适用的关键能力证据。只有在这些条件同时满足时,才会显示通过。运行时无法形成证据的项目会降低证据覆盖率,而不会被当作通过。
当有效证据不足时,平台会给出“证据不足”,而不是把未测成误判为不通过。这表示当前调用不能支持清晰结论,建议在不同时间或条件下复测。
检测不能证明什么
- 不能单独证明底层模型的真实身份或模型权属。
- 不能替代官方文档、供应商合同或厂商认证。
- 不能排除分时段切换路由、按 Key 分流等无法由单次调用完全观察的情况。
因此,检测结果应与渠道公开说明、价格、稳定性、长期复测和业务场景表现一起使用。
相关协议资料
接口结构的基础参考来自 OpenAI Chat Completions API 文档 与 Anthropic Messages API 文档。不同兼容服务可以存在实现差异。
准备好检查一个渠道了吗?开始检测