检测方法论

如何理解一次模型真实性检测

模型检测站通过本次真实 API 调用观察接口行为,为模型选型和渠道风控提供可复核的证据,而不是替代模型厂商认证。

更新于 2026-09-08

检测回答的是什么问题

当一个渠道声称提供某个模型时,调用方通常关心接口是否可用、响应是否符合协议、模型名是否如实回显,以及关键能力是否按预期工作。检测会围绕这些可观察行为建立证据。

这适用于 OpenAI 或 Anthropic 兼容 API。对于不同模型,系统会先识别协议,再仅执行适用的项目;明确不适用的能力不进入评分。

证据从哪里来

协议与响应结构

系统检查端点是否可访问,响应的 ID、内容、错误对象与用量字段是否具备该协议的基本结构,同时观察响应头等实现特征。

声明模型与行为

系统比对接口回显的模型名称与填写的声明模型,并用流式响应、输出控制、多轮上下文、系统指令、工具调用和多模态输入等项目验证接口实际暴露的能力。

重复调用与用量

在适用时,系统比较重复请求的响应形态,检查异常固定响应或重放迹象,并核验 usage 等用量信息是否与响应内容大致一致。

重要:单个异常不等于底层模型被替换。网络抖动、限流、模型版本升级、路由策略与渠道侧缓存都可能影响一次调用的结果。

如何判定结果

检测结果会综合必检项、加权得分、有效证据覆盖率与适用的关键能力证据。只有在这些条件同时满足时,才会显示通过。运行时无法形成证据的项目会降低证据覆盖率,而不会被当作通过。

当有效证据不足时,平台会给出“证据不足”,而不是把未测成误判为不通过。这表示当前调用不能支持清晰结论,建议在不同时间或条件下复测。

检测不能证明什么

因此,检测结果应与渠道公开说明、价格、稳定性、长期复测和业务场景表现一起使用。

相关协议资料

接口结构的基础参考来自 OpenAI Chat Completions API 文档Anthropic Messages API 文档。不同兼容服务可以存在实现差异。

准备好检查一个渠道了吗?开始检测