第 1 章

科普入門:電腦怎麼「看」

在學 YOLO 之前,先建立直覺:對電腦來說,一張影像不是「畫面」,而是一堆數字。 AI 的工作,是把這堆數字變成「有什麼、在哪裡」的答案。

影像對電腦只是數字

一張彩色照片,是由很多像素組成的格子,每個像素用三個 0~255 的數字記錄紅、綠、藍。 一張 1920×1080 的照片就有約 200 萬個像素、600 萬個數字。電腦看不到「人」或「車」—— 它只看到數字。所以「認出物體」本質上是:從數字裡找出有意義的模式

人看圖 vs 電腦看圖

人看整張圖 vs 電腦看像素 RGB 數字
對人,這是「一個人走在路上」;對電腦,只是一格格的 RGB 數字——AI 的工作就是從這些數字學出意義

一眼就知道「街上有幾個人、一台公車」,靠的是一輩子累積的經驗。

電腦

要先用大量「已標好答案」的影像訓練,學會把像素模式對應到類別與位置。

這就是為什麼資料這麼重要:模型只會它看過的東西。沒看過的場景,往往要自己標、自己訓練(第 2、5 章會做)。

物件偵測能做什麼

把「有什麼、在哪裡、有幾個」自動算出來,就能撐起很多應用。每個案例:原圖 → YOLO 偵測 → 說明。

交通原圖
原圖
交通偵測
YOLO 偵測 4 車

交通

車流統計、車種辨識、違規偵測、行人安全。
影像:國道1號即時影像

生活原圖
原圖
生活偵測
YOLO 偵測 5 人

生活 / 零售

來客計數、排隊偵測、居家有人 / 車 / 寵物的通知。

動物原圖
原圖
動物偵測
YOLO 偵測 11 隻

動物

生態監測、農場 / 畜牧計數、路殺預警、野生動物調查。
影像:斑馬群(Wikimedia, CC BY-SA)

製造原圖
原圖
製造偵測
偵測 30 件

製造

產線計數、缺件偵測、料件分類、安全區監控。
自訓練模型偵測金屬零件,做法見第 5 章 · 工業級

為什麼是 YOLO

YOLO(You Only Look Once)最大的特點是:一次掃描整張圖就同時給出所有物體的框與類別, 快到能即時處理影片。這讓它特別適合現場、邊緣裝置(像 Raspberry Pi)上的即時應用。 原理與演進在第 3 章細談。

重點:影像 = 數字;偵測 = 從數字找模式;模型只懂它看過的東西;YOLO 的賣點是「快到能即時」。
← 課程總覽 下一章:核心理論 →