Vision(視覺)
最後更新:2026-08-12· 15 分鐘閱讀
🚀 快速通道
- ChatGPT 國內版:點擊直達↗
- 穩定鏡像站:開啟鏡像↗
- 官方 ChatGPT:chatgpt.com ↗

更新時間:2026-08-12
導讀
Vision(視覺) 指模型同時處理圖像與文字,完成 OCR、圖表解讀、UI 截圖分析、質檢判定等。OpenAI 多模態能力主要透過 Responses API(新整合首選)或 legacy Chat Completions 傳入 image URL / base64。支援視覺的 model ID、content 塊欄位名、視覺 token 折算以 Vision 文件 與 定價頁 為準,模型與價格會更新。
任務選型
| 任務 | 輸入範例 | 輸出 | 預處理 |
|---|---|---|---|
| 票據 OCR | 手機拍照 | JSON 欄位 | 透視矯正、提亮 |
| 文件 QA | PDF 頁截圖 + 問題 | 自然語言 | 按頁拆分 |
| 圖表摘要 | 儀表板截圖 | 趨勢 bullet | 要求引用數值 |
| UI 走查 | 設計稿截圖 | 差異列表 | 固定 viewport |
| 產線質檢 | 產品照片 | pass / fail | 明確 rubric |
不必用 Vision: 純文字 PDF 先抽文字層;極小字號密集表格建議與專用 OCR A/B 測試。
Responses API 接入(推薦)
新整合走 Responses,與工具呼叫、對話狀態統一:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-4o", # 以文件 vision-capable models 為準
instructions="你是單據 OCR 助手。看不清的欄位填 null,不要猜測。",
input=[{
"role": "user",
"content": [
{"type": "input_text", "text": "提取 vendor、date、total,輸出 JSON"},
{"type": "input_image", "image_url": "https://cdn.example.com/invoice.jpg"},
],
}],
)
print(response.output_text)
欄位名(input_text / input_image 等)以當前 API reference 為準。
存量 Chat Completions
已有 messages[].content[] 內 type: image_url 的整合可繼續維護;新功能與長期演進優先遷移 Responses。
圖像輸入方式
| 方式 | 適用 | 風險 |
|---|---|---|
| HTTPS URL | 公網 CDN | 使用者 URL 需防 SSRF |
| Base64 | 內網、上傳直傳 | 請求體大,注意上限 |
| File API + file_id | 重複引用同一圖 | 見 Files 文件 |
SSRF 防護: 使用者 URL 必須在伺服器端拉取;校驗網域白名單,禁止內網與 metadata 位址(169.254.x.x 等)。
成本控管:detail 與預處理
視覺輸入常按 tile / 解析度 折算 token。部分介面支援 detail: low | high | auto:
| 檔位 | 適用 |
|---|---|
low | 場景分類、粗粒度描述 |
high | 小字 OCR、細線圖表 |
auto | 預設策略,見文件 |
控費清單:
- 大圖縮放到 OCR 足夠尺寸(如長邊 ≤ 2048px)
- 多頁 PDF 逐頁呼叫,避免一次 20 張
- 固定版式票據先 ROI 裁剪
- 相同圖片快取解析結果(hash → JSON)
結構化輸出模板
[System]
只輸出 JSON:{"vendor":"","date":"","total":"","items":[]}
禁止 markdown 圍欄與解釋性文字。
[User]
(附圖片)
提取全部可見欄位。
配合 Responses JSON schema / text.format 或 Chat response_format,並在伺服器端 schema 校驗。參數見 文字生成指南。
與 Images API 的邊界
- Image Generation:文字 → 生成新圖
- Vision:圖 → 理解、提取、推理
可串聯:生成素材 → Vision 質檢 → 不合格則 Edits 修正。
隱私與合規
- 身分證、醫療、兒童圖像:最小化採集;日誌不存原圖
- 告知使用者圖像會發往第三方 API;企業場景查閱 DPA
- 跨境傳輸與留存按組織策略設定
常見問題
Vision 能否替代專業 OCR?
清晰掃描件上常夠用;手寫、密集表格、多語言混排需業務樣例 A/B。
單張圖片最大多少?
受請求體與模型策略限制;超大圖應壓縮或分頁,上限見文件。
同圖兩次 OCR 結果不一致?
檢查 temperature;OCR 設低隨機性,並要求 JSON + 伺服器端校驗。
掃描版 PDF 怎麼處理?
Rasterize 為圖片(每頁一張);純文字 PDF 優先抽文字層以省視覺 token。
影片怎麼處理?
抽幀為圖片;即時串流注意 QPS 與成本,可查 Realtime 文件。
官方資源
下一步閱讀
行動路徑
今天:用一張清晰發票走 Responses API,輸出 JSON 欄位。明天:對比 detail low vs high 的 token 與準確率。本週:對 20 張業務樣例建 OCR 基準集,並加上 SSRF 安全拉取與縮圖預處理。
相關內容
ChatGPT / OpenAI 開發指南總覽
2026 OpenAI 開發地圖:ChatGPT 網頁、Platform 控制台與 API 如何分工,以及從入門到生產化的閱讀順序。
OpenAI Platform 開發文件概覽
platform.openai.com 控制台、文件導覽、Playground、用量計費與組織管理——開發者如何高效找 API 資訊。
OpenAI API 快速入門
從 Platform 帳戶、API Key 到第一條 OpenAI API 呼叫:Responses/Completions 範例、計費、限流與安全清單(2026 實操向)。
OpenAI ChatGPT API 開發指南
面向業務接入的 OpenAI API 架構、鑑權、串流輸出、工具呼叫、限流重試與生產化清單。