某个厂商模型宕机时:找谁、如何升级支持工单
当通过聚合站调用 Claude、GPT、DeepSeek 等模型出现错误时,问题可能来自聚合站本身,也可能来自上游厂商。本文说明如何快速区分这两种情况,并提供在聚合站内提交支持工单、升级问题的步骤,帮助你高效获得帮助。
先判断:是聚合站问题还是上游厂商问题
聚合站作为中间层,将你的请求转发给上游厂商(如 Anthropic、OpenAI、DeepSeek 等)。当请求失败时,错误来源可能有两种:
- 聚合站自身故障:例如 API 网关不可用、计费系统异常、密钥池问题等。通常影响所有模型或整个站点。
- 上游厂商故障:仅影响特定厂商的模型(如只有 Claude 报错,GPT 正常)。这可能是厂商侧的服务中断、限流或区域网络问题。
快速区分方法:
- 尝试调用不同厂商的模型(比如同时试 Claude 和 GPT)。如果只有一个厂商的模型失败,很可能是上游问题。
- 查看聚合站的状态页或公告(如果有),确认是否有已知故障。
- 检查错误信息中的关键词:如
upstream error、provider unavailable通常指向厂商侧;gateway timeout、internal error可能指向聚合站。
聚合站侧的问题:如何提交工单
如果确认或怀疑是聚合站自身问题,应通过站内支持渠道提交工单。一般步骤如下:
- 登录聚合站控制台,找到“支持”、“帮助”或“工单”入口。
- 选择问题类型:通常有“API 错误”、“计费问题”、“账户问题”等分类,选择最接近的类别。
- 提供关键信息:
- 你的 API key 标识(不要泄露完整 key,通常提供前缀或 ID 即可)。
- 请求的模型名称(如
claude-3-opus)。 - 完整的错误响应(包括 HTTP 状态码和错误消息)。
- 发生时间(带时区)和请求 ID(如果有)。
- 你已尝试的排查步骤(如更换模型、重试等)。
- 提交并等待回复。工单系统通常会通过邮件或站内通知回复。
上游厂商故障:聚合站能做什么
如果问题源于上游厂商,聚合站一般无法直接修复,但可以:
- 提供状态更新或临时绕过方案(如切换到其他可用厂商的模型)。
- 在厂商恢复后通知你。
- 如果故障持续时间较长,可能调整计费或提供补偿(取决于聚合站政策)。
此时提交工单仍然有用,因为聚合站可以汇总用户反馈,更快推动厂商关注,或确认故障范围。
升级支持工单的时机与方式
如果工单在合理时间内未得到解决,或问题严重影响业务,可以升级:
- 在原有工单中回复,要求升级,并简要说明业务影响(如“生产环境中断”)。
- 通过其他渠道联系:如果聚合站提供即时聊天、社群或邮件,可以通过这些渠道提醒。
- 提供补充信息:如新的错误日志、测试结果,帮助支持团队定位。
注意:升级时保持礼貌,清晰陈述事实,避免重复提交多个工单,以免拖慢处理速度。
预防与日常准备
- 在代码中实现多厂商回退:当某个厂商不可用时,自动切换到其他厂商的模型。
- 监控 API 错误率和延迟,设置告警,以便第一时间发现故障。
- 保留请求日志和错误信息,方便提交工单时快速提供证据。
- 了解聚合站的计费规则:用户按官方价 ×1.3 扣费,贡献 key 按官方价 ×1.1(优质 ×1.2)返 USDC。故障期间的计费处理以聚合站政策为准。
通过以上方法,你可以在模型不可达时快速定位问题并采取正确行动,减少对业务的影响。