Skip to content

Vision(视觉)

最后更新:2026-08-12· 15 分钟阅读

🚀 快速通道

  • ChatGPT 国内版:点击直达↗
  • 稳定镜像站:打开镜像↗
  • 官方 ChatGPT:chatgpt.com ↗

Vision(视觉)

更新时间:2026-08-12

导读

Vision(视觉) 指模型同时处理图像与文本,完成 OCR、图表解读、UI 截图分析、质检判定等。OpenAI 多模态能力主要通过 Responses API(新集成首选)或 legacy Chat Completions 传入 image URL / base64。支持视觉的 model ID、content 块字段名、视觉 token 折算以 Vision 文档 与 定价页 为准,模型与价格会更新。

任务选型

任务输入示例输出预处理
票据 OCR手机拍照JSON 字段透视矫正、提亮
文档 QAPDF 页截图 + 问题自然语言按页拆分
图表摘要仪表盘截图趋势 bullet要求引用数值
UI 走查设计稿截图差异列表固定 viewport
产线质检产品照片pass / fail明确 rubric

不必用 Vision: 纯文本 PDF 先抽文本层;极小字号密集表格建议与专用 OCR A/B 测试。

Responses API 接入(推荐)

新集成走 Responses,与工具调用、对话状态统一:

from openai import OpenAI

client = OpenAI()
response = client.responses.create(
    model="gpt-4o",  # 以文档 vision-capable models 为准
    instructions="你是单据 OCR 助手。看不清的字段填 null,不要猜测。",
    input=[{
        "role": "user",
        "content": [
            {"type": "input_text", "text": "提取 vendor、date、total,输出 JSON"},
            {"type": "input_image", "image_url": "https://cdn.example.com/invoice.jpg"},
        ],
    }],
)
print(response.output_text)

字段名(input_text / input_image 等)以当前 API reference 为准。

存量 Chat Completions

已有 messages[].content[] 内 type: image_url 的集成可继续维护;新功能与长期演进优先迁移 Responses。

图像输入方式

方式适用风险
HTTPS URL公网 CDN用户 URL 需防 SSRF
Base64内网、上传直传请求体大,注意上限
File API + file_id重复引用同一图见 Files 文档

SSRF 防护: 用户 URL 必须在服务端拉取;校验域名白名单,禁止内网与 metadata 地址(169.254.x.x 等)。

成本控管:detail 与预处理

视觉输入常按 tile / 分辨率 折算 token。部分接口支持 detail: low | high | auto:

档位适用
low场景分类、粗粒度描述
high小字 OCR、细线图表
auto默认策略,见文档

控费清单:

  • 大图缩放到 OCR 足够尺寸(如长边 ≤ 2048px)
  • 多页 PDF 逐页调用,避免一次 20 张
  • 固定版式票据先 ROI 裁剪
  • 相同图片缓存解析结果(hash → JSON)

结构化输出模板

[System]
只输出 JSON:{"vendor":"","date":"","total":"","items":[]}
禁止 markdown 围栏与解释性文字。

[User]
(附图片)
提取全部可见字段。

配合 Responses JSON schema / text.format 或 Chat response_format,并在服务端 schema 校验。参数见 文本生成指南。

与 Images API 的边界

  • Image Generation:文本 → 生成新图
  • Vision:图 → 理解、提取、推理

可串联:生成素材 → Vision 质检 → 不合格则 Edits 修正。

隐私与合规

  • 身份证、医疗、儿童图像:最小化采集;日志不存原图
  • 告知用户图像会发往第三方 API;企业场景查阅 DPA
  • 跨境传输与留存按组织策略配置

常见问题

Vision 能否替代专业 OCR?

清晰扫描件上常够用;手写、密集表格、多语言混排需业务样例 A/B。

单张图片最大多少?

受请求体与模型策略限制;超大图应压缩或分页,上限见文档。

同图两次 OCR 结果不一致?

检查 temperature;OCR 设低随机性,并要求 JSON + 服务端校验。

扫描版 PDF 怎么处理?

Rasterize 为图片(每页一张);纯文本 PDF 优先抽文本层以省视觉 token。

视频怎么处理?

抽帧为图片;实时流注意 QPS 与成本,可查 Realtime 文档。

官方资源

下一步阅读

行动路径

今天:用一张清晰发票走 Responses API,输出 JSON 字段。明天:对比 detail low vs high 的 token 与准确率。本周:对 20 张业务样例建 OCR 基准集,并加上 SSRF 安全拉取与缩图预处理。

相关内容