模型能力检测报告
检测只完成兼容性筛查。继续比较价格、真实任务、错误处理与高峰时段表现后再做选择。
担心 Claude、GPT、DeepSeek 等 API 出现能力下降、模型声明不一致或未说明的路由变化?输入公开 HTTPS 地址、临时 API Key 和模型 ID,通过协议、元数据、Token、动态题、SSE 与工具调用等信号进行风险筛查。
先说明检测边界:报告衡量接口兼容性、模型声明一致性和行为抽样结果。它能辅助发现明显的协议缺失、路由差异或能力异常,但不能仅凭一次黑盒测试证明底层模型身份,也不属于任何模型厂商认证。
正在向目标接口执行固定探针,请勿关闭页面。标准检测通常需要 30–120 秒。
报告会展示每项通过、存疑或失败的依据,而不是只给一个无法解释的百分比。
检测只完成兼容性筛查。继续比较价格、真实任务、错误处理与高峰时段表现后再做选择。
一次回答像不像某个模型,只能算弱信号。更有价值的是把模型声明、协议字段、计费数据和能力探针放在同一份报告里交叉核对。
请求的模型 ID 与响应 model 持续不同,可能是别名映射、网关改写或实际路由变化,需要向服务商核实。
usage 长期缺失、Token 算术不一致,或响应对象关键字段大量缺失,说明计费透明度或协议兼容性不足。
固定指令、随机动态题、SSE 或工具调用持续失败,可能反映能力降级、兼容层缺陷或不同时间段的路由漂移。
同一参数在不同时段的结构和能力表现突然变化,值得保存报告重复对比;风格和 cutoff 不能单独作为真假结论。
不要误判:/models 返回 401、403、429 或不公开,不等于模型造假;单项失败也可能来自网关配置、限流或模型参数差异。应结合多项证据、多轮检测和真实业务题集判断。
建议使用临时限额 Key,并在低峰和高峰各检测一次。需要比较多个中转站时,请保持模型、参数和业务题集一致。
Base URL 填到版本路径,例如 https://api.example.com/v1,不要附加具体接口路径。
填写控制台中的准确模型 ID,选择“标准”模式;检测会产生少量上游请求和 Token 费用。
优先查看响应模型、Token、动态题、SSE 和工具调用证据。总分反映兼容度,不等于模型身份认证。
结构化协议信号参与兼容度评分;风格与知识边界仅记录观察结果,避免把弱证据包装成模型认证。
检查 Bearer 认证状态、/models 返回结构和所选模型是否可见;模型列表受限时单独标注,不直接判定造假。
检查 Chat Completions 的 HTTP 状态、响应 JSON 和关键字段,不把行为结果混入协议分。
要求模型原样返回服务端随机字符串,独立标注额外解释、标点或格式改写,不与协议结构混算。
采集 id、object、created、model、请求 ID 和可选系统指纹。
校验输入、输出、总 Token 是否完整、非负且算术一致,并给出 Token/字符相对指纹。
固定提示词采集字符、段落、标题、列表和代码围栏等结构信号,仅供重复检测对比。
采集模型对知识截止时间的结构化自述;该结果是弱信号,不单独参与兼容度评分。
服务端随机生成多步计算参数和 nonce,精确核对答案与随机值,降低固定题适配影响。
验证 text/event-stream、增量事件、结束标记、输出拼接和流式 usage 是否可识别。
强制调用带 JSON Schema 的固定函数,校验工具名、参数结构和随机 nonce 是否原样返回。
模型身份属于黑盒推断问题。公开研究表明,需要多条主动探针和重复采样才能建立可比较的指纹;影子 API 也可能在能力、安全行为和身份测试上偏离官方接口。
本站为独立实现,与论文作者及其他检测平台无隶属关系。引用只用于说明方法边界,不代表复现论文完整题集或准确率。本次检测的大部分协议和能力探针通过,可以继续做业务场景测试。
基础调用可能可用,但流式、工具、usage 或模型路由存在差异,应查看失败证据。
认证、协议或关键能力存在明显异常,不建议只凭一次普通聊天成功就投入生产。
本工具可检测符合协议范围的第三方公开中转站,并不只服务于 AI快站。若你还需要备用线路或统一接入国内外模型,可以在完成对比后再查看 AI快站的模型与价格。
总分只能概括本轮兼容性。需要结合分项证据、固定业务题集和多时段复测,才能识别持续的能力或路由变化。
先理解报告能证明什么、不能证明什么,再决定是否接入生产。
不能。黑盒接口检测只能核对协议、元数据和模型行为是否与声明相符。中转站可以改写 model 等字段,行为题也存在误差,因此报告不等同于模型厂商认证。
先用同一模型 ID 重复执行标准检测,对比固定指令、动态题、工具调用、SSE、Token 字段和响应模型声明,再补充自己的真实业务题集。若关键能力持续失败、结果明显漂移或高峰期表现突变,说明存在能力降级或路由变化风险,但仍不能仅凭单轮结果确定原因。
请求模型与响应 model 字段持续不一致、关键协议字段大量缺失、原本声明支持的工具调用或流式输出不可用、动态题表现与已知基线长期偏离,都值得进一步排查。单个异常可能来自网关兼容问题,必须结合多项证据和多轮结果判断。
可以检测这些模型在公开 HTTPS OpenAI Chat Completions 兼容入口上的表现,前提是中转站使用 Bearer API Key 且模型能通过 model ID 调用。本工具检测的是兼容端点,不代表覆盖厂商原生 Anthropic Messages、Gemini generateContent 或 OpenAI Responses API。
模型自述容易受系统提示、网关改写、训练数据和角色设定影响,也可以被中转站统一改写。更可靠的筛查方式是交叉核对协议元数据、Token、随机动态题、流式输出、工具调用和多轮行为变化。
不会。API Key 只在本次检测请求内用于访问你填写的中转地址,不写入数据库、缓存、页面地址或检测报告。建议创建临时 Key,并在检测后撤销。
检测请求包含 API Key。只允许公开 HTTPS 地址可以降低密钥被明文传输、访问本机或内网服务以及滥用开放代理的风险。
支持使用 Bearer API Key、提供 OpenAI Chat Completions 兼容接口的公开 HTTPS 中转站。Anthropic Messages、Gemini generateContent、OpenAI Responses API 和私有自定义协议不能直接使用这套固定探针。
快速检测约 3 次请求,主要检查认证、协议、元数据、计费 Token 字段和 R1 动态题;标准检测约 7 次请求,并增加输出风格、知识 cutoff、SSE 流式输出和工具调用,可能产生更多 Token 费用。
为防止接口滥用,检测服务会做基础频率与并发控制:同一客户端通常 10 分钟最多发起 6 轮检测,同时最多运行 2 轮。该限制由边缘节点尽力执行,繁忙时也可能临时收紧,请稍后再试。
不能。单次风格样本和模型自述的知识截止时间都容易受系统提示、网关改写和随机性影响,因此只标为观察信号,不计入接口综合兼容度。可靠的模型指纹需要固定题集、多轮采样和已知基线。
不代表。单次检测只反映当前时点。生产上线还需要持续测试延迟、并发、限流、错误率、超时、重试、路由变化和账单一致性。