检测前的准备
- 使用权限和额度都可控的临时测试 Key。不要提交长期生产 Key。
- 填写渠道给出的 API 地址与实际要求的完整模型名称。
- 确认该渠道允许你进行测试调用,并预留少量 Token 费用。
发起检测时填写什么
API 地址应填写渠道提供的兼容接口根地址,例如带有版本路径的地址。声明模型名称应填写渠道实际要求的模型 ID,而不是你认为它对应的别名。系统会自动识别 OpenAI 或 Anthropic 兼容协议。
结果应该怎样读
通过
表示本次调用中,必检项、得分、有效证据覆盖率和适用的关键能力证据均达到通过条件。它说明接口行为与声明之间没有发现足以阻断的异常,不等同于厂商认证。
未通过
表示本次调用中存在未满足通过条件的项目。先查看具体异常项,再结合渠道文档、服务公告和复测结果判断原因。
证据不足
表示本次调用没有取得足够的有效证据。常见原因包括响应超时、限流、暂时的上游拒绝或部分能力无法完成验证。此时不应把结果理解成模型不通过。
建议复测:如果检测结果会影响采购、生产迁移或风控决策,请在不同时段复测,并保留同一模型在不同渠道的结果作横向参考。
哪些现象值得进一步核实
- 接口回显的模型名称与声明模型明显不一致。
- 流式响应、工具调用、上下文或输出控制等应有能力持续异常。
- 重复请求出现不符合预期的固定响应或重放迹象。
- 用量字段、错误结构或协议特征长期与兼容规范不一致。
避免常见误读
一次输出质量下降不必然意味着模型被替换。不同提示词、采样参数、上游负载、模型版本、缓存和路由策略都会造成差异。检测给出的是可观察的行为证据,应作为进一步核实的起点。
查看检测标准与边界阅读方法论