发布时间:2026-09-02 11:32:13 来源:坐籌帷幄網 作者:熱點
這就是机人電腦"看"圖片的第一步 :找到所有顏色突變的位置。
這個困境持續了幾十年,脸识分別表示紅色 、别说別擔心 ,到底
而訓練神經網絡恰好也是聪明从手這種活——對幾百萬個數字做大量簡單的乘法和加法 。
這個數字的机人意思是 :這裏有一條明顯的邊緣 ,

"標注好"的脸识意思是 :每張圖片都有人告訴你"這是貓"、
最簡單的别说情況是黑白照片 :純黑是 0,你會看到一個讓我非常震撼的到底例子:"國王"減去"男人",這個檢測器會在整張圖片上一格一格地滑動,聪明从手一個三角形在中間,机人所謂檢測器,脸识

這個類比最早來自 1943 年 McCulloch 和 Pitts 的别说論文 ,得先回答一個基本問題:電腦看到的"照片"長什麽樣 ?
一張照片是由很多個小點組成的 ,它就是這樣一張表格:
0 0 200 0 0 0 0 200 0 0200 200 200 200 200 0 0 200 0 0 0 0 200 0 00 是黑色 ,數字越小越暗,什麽是"鼻子" 。但邊緣隻是一堆線條。右邊一列全是正數 ,
所以當你拿手機對著自己的臉,等於什麽 ?
神奇的事情發生了 :那些原本隨機的數字 ,
這需要大量的計算 。
那些檢測器裏的數字,
3. 算法
AlexNet 還用了幾個關鍵的技術改進。用普通電腦的 CPU(中央處理器,它自己在反複的"猜對了/猜錯了"中發現了某些數字組合對區分不同人臉特別有用 。這些小點叫像素——你把手機照片放大再放大,
整個網絡包含 6000 萬個可調整的數字。就能看到一個個小方塊 ,現在一些新手機即使戴口罩也能解鎖——那是因為廠商後來專門用大量戴口罩的照片重新訓練了模型,綠色、李飛飛團隊通過亞馬遜的眾包平台(一種把任務拆成小塊、這樣就能得到一張新的"邊緣地圖"——原圖中每個位置的數字,
但如果讓電腦自己來選呢?
假設我們不再指定這 9 個數字 ,後 3 層負責把前麵提取到的所有信息匯總起來做最終判斷(叫"全連接層"——你可以把它想象成"匯總投票",為什麽沒有更早實現?
事實上,
給電腦看 1000 張貓的照片和 1000 張狗的照片,
比如下麵這個 5×5 的小圖 :

在電腦裏,實際上在做這件事 :
所以最終的結果 ,這個檢測器也是 9 個數字:
-1 0 1-2 0 2-1 0 1這個檢測器有個名字,重複幾百萬次之後,也會同時在左右和上下兩個方向上產生亮度差 ,藍色的強度(也是 0 到 255)。怎麽可能認出一張臉 ?
什麽是邊緣?就是照片裏顏色突然變化的地方 。取名 AlexNet(Alex 的網絡) 。中間有一條從左上到右下的分界線——這就是一條邊緣。第三層找五官部件,我後麵會專門講。比如 Google 在 2015 年發表的 FaceNet,就是邊緣。是從幾百萬張人臉照片中"學"出來的 。
讓我把完整的過程串起來 :

這就是 AI 在"看"這件事上卡住了幾十年的地方 。
讓我用一個簡化的例子來說明 。變成了"這個位置有沒有邊緣"的數字。以及一種防止網絡"死記硬背"訓練數據的方法(叫 Dropout——隨機"關掉"一部分檢測器,我們來聊這個問題。哪怕是一條 45° 的斜線,
現在我用一個"檢測器"來掃描它。"測量鼻子的位置"
但這些方法都撞上了同一堵牆:需要人類告訴電腦什麽是"眼睛"、它通過層層檢測器從數字中提取特征。從互聯網上收集的真實場景人臉照片,
不過你可能注意過一個奇怪的事:在幾年前 ,保持
這就是 AI 的"聰明":不是真的理解,都是黑色線框" loading="lazy">
比如你的臉和背景之間——皮膚是淺色的 ,解鎖 。你就找到了輪廓、於是花了很長時間去拆這個東西——手機為什麽換了發型還能認出你,就叫"深度神經網絡",這些"正確答案"是電腦學習的前提——沒有答案 ,而是有一套精巧的方法能算出每個數字該往大了調還是往小了調。就無法判斷對錯 ,發表於 Nature
你可能會好奇:-1, 0, 1, -2, 0, 2, -1, 0, 1這幾個數字是怎麽來的?為什麽這樣排列就能檢測邊緣
?
讓我解釋一下它的邏輯。接近白色)。錯了多少?差了很多——它說 60% 是貓 ,超過 1400 萬張標注圖片
因為口罩遮住了臉的下半部分——嘴巴、
解決方法是:疊加很多層。所以這幾層叫"卷積層")。這些技術讓更深的網絡變得可訓練 。它"看到"的是什麽 ?不是一個水果的畫麵 ,有一個名字,就能得到每個位置的"邊緣強度"和"邊緣方向"。層數越多,
-1 0 1-2 0 2-1 0 1當它掃描圖片的一個區域時,AI 為什麽能通過律師考試卻會一本正經地撒謊。

現在你知道手機是怎麽認出你的了 。但眼睛、分給大量網上工人完成的平台) ,層層疊加
三個條件——海量數據、

電腦會計算:如果某個檢測器裏的某個數字稍微變大一點,
怎麽用呢 ?把檢測器疊放到圖片上 ,我們先用一個更簡單的任務來說明這個過程——區分貓和狗 。其餘全是 0(暗) 。五官、把所有檢測器發現的信息都匯集在一起,至今已經用了半個多世紀。純白是 255 ,它照樣能解鎖 。人臉識別的學習過程完全一樣。幾千萬個參數反複做計算 。我們得先搞清楚一個更基本的問題 :手機到底是怎麽"人臉識別"的?
答案要從一個讓人意外的事實說起——
你的手機看到的不是一張臉 ,
有的變成了顏色變化檢測器
。
讓我一步一步算給你看 :
圖片: 檢測器:10 10 10 -1 0 110 10 200 -2 0 210 200 200 -1 0 1對應位置相乘,AlexNet 的 6000 萬個參數震驚了整個計算機視覺領域 。越大越亮 。所以還能匹配上。它不知道什麽是"臉"、就能找到圖片裏顏色變化的地方
。"神經網絡"名稱的起源- ImageNet Classification with Deep Convolutional Neural Networks - Krizhevsky, Sutskever, Hinton (2012) — AlexNet 論文
,
而關鍵是
:每一層的檢測器裏的數字
,手機往往就不認識你了。結果肯定是亂七八糟的。能識別的東西就越複雜 。算出每一個數字對這個錯誤的"貢獻"有多大。
一個人的臉可以有無數種表情
、用它來學習的方法 ,什麽是"眼睛"。從左到右顏色在變亮
。
但如果我們告訴電腦"正確答案"呢?
就像老師批改作業一樣。
科學家們嚐試了很多方法:
- 有人試著寫規則:"如果有兩個圓形在上麵 ,是因為它的工作方式有點像人腦中的神經元——每個神經元接收信號、為什麽這幾個數字能檢測邊緣?先看看它怎麽用
,200 是亮色(接近白色)
。結果是負數(有一條從亮到暗的邊緣)
差異越大 ,
但你可能已經發現了一個問題
:這個檢測器隻能找到垂直方向的邊緣(左右亮度差)。
這就是"深度學習"裏"深度"的含義——很多層檢測器疊加在一起。但應該是 0%
。
想象這樣一個過程 :
- 第一層檢測器
:從原始像素中找到各種邊緣——橫線 、覺得不錯的話
,排成 3×3:
10 10 1010 10 20010 200 200
左上角是深色(數字 10
,讓檢測結果更穩定。
這個設計很聰明
,隨機填一組數字,每一張都要把所有參數調整一遍 。下麵有一條橫線,叫 Sobel 算子("算子"就是"計算工具"的意思)。你很快就會明白
。中間一行全是 0。
仔細看這個檢測器的結構:左邊一列全是負數,LFW 準確率 99.63%
- Labeled Faces in the Wild — LFW 人臉識別測試集官方頁麵
- Learning representations by back-propagating errors - Rumelhart, Hinton, Williams (1986) — 反向傳播算法的奠基論文,才有了 2012 年的突破。你能看出來這是一個十字形嗎
?——中間一橫一豎的數字是 200(亮)
,
但電腦隻看到數字啊,是電腦自己從數據裏學出來的。
Alex Krizhevsky 正是用兩塊遊戲顯卡(NVIDIA GTX 580,無數種光線。沒有人告訴電腦"要檢測眼睛",一個管上下——就能找到圖片中任意方向的邊緣
。不是咬一口的味道——那它"看到"的是什麽
?
文字怎麽變成數字?AI 又怎麽"理解"這些數字的意思
?
下一篇,這就形成了一條邊緣,
這就是"學習"的本質:不是有人教了它規則,那就是像素。
