第 1 章
科普入門:電腦怎麼「看」
在學 YOLO 之前,先建立直覺:對電腦來說,一張影像不是「畫面」,而是一堆數字。 AI 的工作,是把這堆數字變成「有什麼、在哪裡」的答案。
影像對電腦只是數字
一張彩色照片,是由很多像素組成的格子,每個像素用三個 0~255 的數字記錄紅、綠、藍。 一張 1920×1080 的照片就有約 200 萬個像素、600 萬個數字。電腦看不到「人」或「車」—— 它只看到數字。所以「認出物體」本質上是:從數字裡找出有意義的模式。
人看圖 vs 電腦看圖
人
一眼就知道「街上有幾個人、一台公車」,靠的是一輩子累積的經驗。
電腦
要先用大量「已標好答案」的影像訓練,學會把像素模式對應到類別與位置。
這就是為什麼資料這麼重要:模型只會它看過的東西。沒看過的場景,往往要自己標、自己訓練(第 2、5 章會做)。
物件偵測能做什麼
把「有什麼、在哪裡、有幾個」自動算出來,就能撐起很多應用。每個案例:原圖 → YOLO 偵測 → 說明。


交通
車流統計、車種辨識、違規偵測、行人安全。
影像:國道1號即時影像


生活 / 零售
來客計數、排隊偵測、居家有人 / 車 / 寵物的通知。


動物
生態監測、農場 / 畜牧計數、路殺預警、野生動物調查。
影像:斑馬群(Wikimedia, CC BY-SA)
為什麼是 YOLO
YOLO(You Only Look Once)最大的特點是快:一次掃描整張圖就同時給出所有物體的框與類別, 快到能即時處理影片。這讓它特別適合現場、邊緣裝置(像 Raspberry Pi)上的即時應用。 原理與演進在第 3 章細談。
重點:影像 = 數字;偵測 = 從數字找模式;模型只懂它看過的東西;YOLO 的賣點是「快到能即時」。

