vision-multiturn-screenshot-debug · ZH · 2026-10-08

多轮截图排障:如何让图片上下文跨轮保留

在多轮排障对话中,截图是最有效的上下文,但每轮重复发送图片会显著增加 token 消耗。本文讨论长对话中图片上下文的保留策略:何时复用历史图片、何时重新发送、如何控制 token 增长,以及聚合站按官方价 1.3 倍计费下重复发送图片的真实成本。

多轮排障为什么需要保留图片上下文

排障对话通常从一张截图开始:错误弹窗、日志片段、配置界面、监控图表。后续几轮对话中,你需要模型理解这张图里的信息,再结合新信息继续推理。如果模型「忘记」了上一轮的图片,你就得重新发送,或者用文字复述图片内容。

在聚合站上,图片和文字一样计入 token。每次重新发送,都会产生一次新的输入 token 消耗,并按官方价 ×1.3 扣费。因此,图片上下文管理直接影响排障效率和成本。

图片在多轮对话中的两种处理方式

调用 LLM API 时,多轮对话本质上是把历史消息重新发送给模型。图片有两种存在形式:

  • 作为历史消息保留:图片随对话历史一起发送,模型每一轮都能「看到」它。
  • 作为引用替代:只在第一轮发送图片,后续轮次用文字摘要或图片描述代替。

两者没有绝对优劣,取决于排障阶段和图片信息密度。

重复发送图片的 token 成本

图片的 token 消耗取决于分辨率、模型和图片编码方式。通常,一张中等复杂度的截图会占用几百到上千 token。如果对话有 10 轮,每轮都带同一张图,输入 token 会线性增长。

在聚合站上,这些输入 token 按官方价 ×1.3 计费。也就是说,重复发送图片的成本是官方价的 1.3 倍,而不是折扣价。如果图片信息已经被模型理解,继续重复发送就是纯浪费。

何时该重新发送图片

以下情况建议重新发送或保留图片:

  • 模型需要重新查看细节:例如上一轮只讨论了错误码,这一轮需要看堆栈里的具体函数名。
  • 对话被截断或压缩:如果中间做了历史摘要,图片可能丢失,需要重新提供。
  • 新截图包含关键变化:例如修复后界面变了,需要对比。
  • 模型明确表示看不到或记不清:与其反复文字描述,不如直接再传一次。

何时该用文字替代图片

以下情况建议把图片内容转成文字:

  • 图片信息已经稳定:例如错误信息已经提取成文本,后续只需要引用。
  • 只需要部分信息:截图很大但只关心其中一行日志,文字复述更省 token。
  • 对话轮次很多:历史图片会使上下文迅速膨胀,文字摘要更可控。
  • 图片包含敏感信息:不重复发送可以降低泄露面。

控制 token 增长的实用策略

1. 首轮发送完整截图,后续轮次用文字锚点

第一轮把截图和你的问题一起发出去,让模型提取关键信息。之后用文字引用这些信息,例如「刚才截图里的 502 错误出现在网关日志第 3 行」。模型基于历史理解即可继续。

2. 把截图转成结构化文字

让模型在首轮输出一个结构化摘要:错误类型、关键变量、时间戳、请求 ID。后续轮次只带这个摘要,不带原图。这样既保留信息,又避免图片重复计费。

3. 只在必要时重新发送图片

如果模型确实需要重新查看图片细节,再发一次。发送前想清楚:这次发送能带来多少新信息?如果只是确认,用文字即可。

4. 分段排障,避免超长对话

把排障拆成多个短会话:定位问题、分析原因、验证修复。每个会话只带当前阶段需要的图片。这样每段对话的 token 基数小,增长也可控。

5. 注意聚合站的计费方式

聚合站按官方价 ×1.3 扣费,贡献 key 按官方价 ×1.1 或 ×1.2 返 USDC。这意味着你每多发送一次图片,就多付一次 1.3 倍的输入 token 费用。规划图片上下文时,把这一点算进去。

一个典型的多轮排障流程

假设你在排查一个前端报错:

  1. 第一轮:发送错误截图 + 问题描述。模型识别出是跨域问题。
  2. 第二轮:用文字补充「后端已配置 CORS,但预检请求返回 403」。不重复发送截图。
  3. 第三轮:发送后端 CORS 配置的截图。这是新信息,值得发送。
  4. 第四轮:模型给出修改建议,你用文字确认已修改。
  5. 第五轮:如果问题仍在,重新发送浏览器控制台的新截图。

这样只在第 1、3、5 轮发送图片,其余轮次用文字。相比每轮都发图,输入 token 显著减少,且不影响排障效果。

常见误区

  • 每轮都发同一张图:模型并不需要反复看同一张图,除非你要求它重新检查细节。
  • 用图片代替文字描述:如果一句话能说清,就不必用图片。图片 token 通常比文字多。
  • 忽略历史图片的累积成本:多轮对话中,历史图片会随每轮请求重复发送,成本是累加的。
  • 认为聚合站会缓存图片:API 调用是无状态的,每次请求都要带上完整上下文(除非使用平台特有的缓存机制)。

总结

多轮排障中,图片上下文的管理核心是:只在信息增量最大时发送图片,其余时候用文字锚点。这样既能保持模型对问题的理解,又能控制 token 增长。在按官方价 ×1.3 计费的聚合站上,减少不必要的图片重复发送,就是直接降低成本。