01 / DECIDE
架構決策
適合 document intake、visual QA、accessibility 與 mixed text-image analysis。
保存 original asset、定義 allowed observation,並把 visual extraction 與高影響 decision 分開。 先把 input、output、state、tool 與 side effect 畫成一條可觀察路徑,再決定 把 image 當成有限證據 的 owner。
02 / OPERATE
三步野戰程序
- 01
鎖定合約
寫下 caller、資料分類、成功條件、timeout、取消與 ownership。適合 document intake、visual QA、accessibility 與 mixed text-image analysis。
- 02
執行有界路徑
只建立一條 end-to-end path,保留 correlation、typed state 與 reversible failure。保存 original asset、定義 allowed observation,並把 visual extraction 與高影響 decision 分開。
- 03
驗證訊號
把驗收變成可重跑的 fixture、contract test 或 browser test。Labeled set 衡量 extraction accuracy、abstention、OCR error、crop 與 resolution sensitivity。
03 / BOUND
Operation 邊界
不可只靠 visual output 做 identity、diagnosis、safety certification 或 disciplinary action。
04 / PROVE
驗收證據
Labeled set 衡量 extraction accuracy、abstention、OCR error、crop 與 resolution sensitivity。
SOURCE / HTTP
可重現來源探針
curl -fsSI 'https://docs.x.ai/developers/model-capabilities/images/understanding' | sed -n '1,5p'