Skip to content

Vision(視覺)

最後更新:2026-08-12· 15 分鐘閱讀

🚀 快速通道

  • ChatGPT 國內版:點擊直達↗
  • 穩定鏡像站:開啟鏡像↗
  • 官方 ChatGPT:chatgpt.com ↗

Vision(視覺)

更新時間:2026-08-12

導讀

Vision(視覺) 指模型同時處理圖像與文字,完成 OCR、圖表解讀、UI 截圖分析、質檢判定等。OpenAI 多模態能力主要透過 Responses API(新整合首選)或 legacy Chat Completions 傳入 image URL / base64。支援視覺的 model ID、content 塊欄位名、視覺 token 折算以 Vision 文件 與 定價頁 為準,模型與價格會更新。

任務選型

任務輸入範例輸出預處理
票據 OCR手機拍照JSON 欄位透視矯正、提亮
文件 QAPDF 頁截圖 + 問題自然語言按頁拆分
圖表摘要儀表板截圖趨勢 bullet要求引用數值
UI 走查設計稿截圖差異列表固定 viewport
產線質檢產品照片pass / fail明確 rubric

不必用 Vision: 純文字 PDF 先抽文字層;極小字號密集表格建議與專用 OCR A/B 測試。

Responses API 接入(推薦)

新整合走 Responses,與工具呼叫、對話狀態統一:

from openai import OpenAI

client = OpenAI()
response = client.responses.create(
    model="gpt-4o",  # 以文件 vision-capable models 為準
    instructions="你是單據 OCR 助手。看不清的欄位填 null,不要猜測。",
    input=[{
        "role": "user",
        "content": [
            {"type": "input_text", "text": "提取 vendor、date、total,輸出 JSON"},
            {"type": "input_image", "image_url": "https://cdn.example.com/invoice.jpg"},
        ],
    }],
)
print(response.output_text)

欄位名(input_text / input_image 等)以當前 API reference 為準。

存量 Chat Completions

已有 messages[].content[] 內 type: image_url 的整合可繼續維護;新功能與長期演進優先遷移 Responses。

圖像輸入方式

方式適用風險
HTTPS URL公網 CDN使用者 URL 需防 SSRF
Base64內網、上傳直傳請求體大,注意上限
File API + file_id重複引用同一圖見 Files 文件

SSRF 防護: 使用者 URL 必須在伺服器端拉取;校驗網域白名單,禁止內網與 metadata 位址(169.254.x.x 等)。

成本控管:detail 與預處理

視覺輸入常按 tile / 解析度 折算 token。部分介面支援 detail: low | high | auto:

檔位適用
low場景分類、粗粒度描述
high小字 OCR、細線圖表
auto預設策略,見文件

控費清單:

  • 大圖縮放到 OCR 足夠尺寸(如長邊 ≤ 2048px)
  • 多頁 PDF 逐頁呼叫,避免一次 20 張
  • 固定版式票據先 ROI 裁剪
  • 相同圖片快取解析結果(hash → JSON)

結構化輸出模板

[System]
只輸出 JSON:{"vendor":"","date":"","total":"","items":[]}
禁止 markdown 圍欄與解釋性文字。

[User]
(附圖片)
提取全部可見欄位。

配合 Responses JSON schema / text.format 或 Chat response_format,並在伺服器端 schema 校驗。參數見 文字生成指南。

與 Images API 的邊界

  • Image Generation:文字 → 生成新圖
  • Vision:圖 → 理解、提取、推理

可串聯:生成素材 → Vision 質檢 → 不合格則 Edits 修正。

隱私與合規

  • 身分證、醫療、兒童圖像:最小化採集;日誌不存原圖
  • 告知使用者圖像會發往第三方 API;企業場景查閱 DPA
  • 跨境傳輸與留存按組織策略設定

常見問題

Vision 能否替代專業 OCR?

清晰掃描件上常夠用;手寫、密集表格、多語言混排需業務樣例 A/B。

單張圖片最大多少?

受請求體與模型策略限制;超大圖應壓縮或分頁,上限見文件。

同圖兩次 OCR 結果不一致?

檢查 temperature;OCR 設低隨機性,並要求 JSON + 伺服器端校驗。

掃描版 PDF 怎麼處理?

Rasterize 為圖片(每頁一張);純文字 PDF 優先抽文字層以省視覺 token。

影片怎麼處理?

抽幀為圖片;即時串流注意 QPS 與成本,可查 Realtime 文件。

官方資源

下一步閱讀

行動路徑

今天:用一張清晰發票走 Responses API,輸出 JSON 欄位。明天:對比 detail low vs high 的 token 與準確率。本週:對 20 張業務樣例建 OCR 基準集,並加上 SSRF 安全拉取與縮圖預處理。

相關內容