Vision(视觉)
最后更新:2026-08-12· 15 分钟阅读
🚀 快速通道
- ChatGPT 国内版:点击直达↗
- 稳定镜像站:打开镜像↗
- 官方 ChatGPT:chatgpt.com ↗

更新时间:2026-08-12
导读
Vision(视觉) 指模型同时处理图像与文本,完成 OCR、图表解读、UI 截图分析、质检判定等。OpenAI 多模态能力主要通过 Responses API(新集成首选)或 legacy Chat Completions 传入 image URL / base64。支持视觉的 model ID、content 块字段名、视觉 token 折算以 Vision 文档 与 定价页 为准,模型与价格会更新。
任务选型
| 任务 | 输入示例 | 输出 | 预处理 |
|---|---|---|---|
| 票据 OCR | 手机拍照 | JSON 字段 | 透视矫正、提亮 |
| 文档 QA | PDF 页截图 + 问题 | 自然语言 | 按页拆分 |
| 图表摘要 | 仪表盘截图 | 趋势 bullet | 要求引用数值 |
| UI 走查 | 设计稿截图 | 差异列表 | 固定 viewport |
| 产线质检 | 产品照片 | pass / fail | 明确 rubric |
不必用 Vision: 纯文本 PDF 先抽文本层;极小字号密集表格建议与专用 OCR A/B 测试。
Responses API 接入(推荐)
新集成走 Responses,与工具调用、对话状态统一:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-4o", # 以文档 vision-capable models 为准
instructions="你是单据 OCR 助手。看不清的字段填 null,不要猜测。",
input=[{
"role": "user",
"content": [
{"type": "input_text", "text": "提取 vendor、date、total,输出 JSON"},
{"type": "input_image", "image_url": "https://cdn.example.com/invoice.jpg"},
],
}],
)
print(response.output_text)
字段名(input_text / input_image 等)以当前 API reference 为准。
存量 Chat Completions
已有 messages[].content[] 内 type: image_url 的集成可继续维护;新功能与长期演进优先迁移 Responses。
图像输入方式
| 方式 | 适用 | 风险 |
|---|---|---|
| HTTPS URL | 公网 CDN | 用户 URL 需防 SSRF |
| Base64 | 内网、上传直传 | 请求体大,注意上限 |
| File API + file_id | 重复引用同一图 | 见 Files 文档 |
SSRF 防护: 用户 URL 必须在服务端拉取;校验域名白名单,禁止内网与 metadata 地址(169.254.x.x 等)。
成本控管:detail 与预处理
视觉输入常按 tile / 分辨率 折算 token。部分接口支持 detail: low | high | auto:
| 档位 | 适用 |
|---|---|
low | 场景分类、粗粒度描述 |
high | 小字 OCR、细线图表 |
auto | 默认策略,见文档 |
控费清单:
- 大图缩放到 OCR 足够尺寸(如长边 ≤ 2048px)
- 多页 PDF 逐页调用,避免一次 20 张
- 固定版式票据先 ROI 裁剪
- 相同图片缓存解析结果(hash → JSON)
结构化输出模板
[System]
只输出 JSON:{"vendor":"","date":"","total":"","items":[]}
禁止 markdown 围栏与解释性文字。
[User]
(附图片)
提取全部可见字段。
配合 Responses JSON schema / text.format 或 Chat response_format,并在服务端 schema 校验。参数见 文本生成指南。
与 Images API 的边界
- Image Generation:文本 → 生成新图
- Vision:图 → 理解、提取、推理
可串联:生成素材 → Vision 质检 → 不合格则 Edits 修正。
隐私与合规
- 身份证、医疗、儿童图像:最小化采集;日志不存原图
- 告知用户图像会发往第三方 API;企业场景查阅 DPA
- 跨境传输与留存按组织策略配置
常见问题
Vision 能否替代专业 OCR?
清晰扫描件上常够用;手写、密集表格、多语言混排需业务样例 A/B。
单张图片最大多少?
受请求体与模型策略限制;超大图应压缩或分页,上限见文档。
同图两次 OCR 结果不一致?
检查 temperature;OCR 设低随机性,并要求 JSON + 服务端校验。
扫描版 PDF 怎么处理?
Rasterize 为图片(每页一张);纯文本 PDF 优先抽文本层以省视觉 token。
视频怎么处理?
抽帧为图片;实时流注意 QPS 与成本,可查 Realtime 文档。
官方资源
下一步阅读
行动路径
今天:用一张清晰发票走 Responses API,输出 JSON 字段。明天:对比 detail low vs high 的 token 与准确率。本周:对 20 张业务样例建 OCR 基准集,并加上 SSRF 安全拉取与缩图预处理。
相关内容
ChatGPT / OpenAI 开发指南总览
2026 OpenAI 开发地图:ChatGPT 网页、Platform 控制台与 API 如何分工,以及从入门到生产化的阅读顺序。
OpenAI Platform 开发文档概览
platform.openai.com 控制台、文档导航、Playground、用量计费与组织管理——开发者如何高效找 API 信息。
OpenAI API 快速入门
从 Platform 账户、API Key 到第一条 OpenAI API 调用:Responses/Completions 示例、计费、限流与安全清单(2026 实操向)。
OpenAI ChatGPT API 开发指南
面向业务接入的 OpenAI API 架构、鉴权、流式输出、工具调用、限流重试与生产化清单。