← 配套《探针6·GPT 是怎么看懂一张图的》,回文章看原理
交互工具 · 探针6 配套

图像 patch 切块演示

模型从不直接看像素——图先被切成一堆 patch 小方块(ViT 经典 16×16),每块压成一个 token,和文字 token 一起喂进去。上传一张图,调 patch 大小,看它被切成几行几列、吃掉多少 token:一张随手发的图,几百上千 token 轻轻松松,把你的对话历史挤出窗口。

纯前端 canvas 切块,按 ⌈W/p⌉ × ⌈H/p⌉ 公式算 token 数,零 API、零延迟。

把图切成 patch

每个 patch = 1 个 token
patch 大小16×16 px

ViT 经典 16×16,各家模型不同。越小→块越多→越费 token;越大→越省但丢细节。

图尺寸
320 × 320 px
切成
20 行 × 20
图占 token = patch 数
400
400 个中文字的体量(1 patch ≈ 1 token ≈ 1 中文字)

一张随手发的图,几百上千 token 轻轻松松——在固定大小的窗口里,这些 token 把你的对话历史挤出去了。 (这也是 AI 看图会「看错小字」的根源:细节在 patch 压缩里丢了。)