LESSON 1 / 24免費試讀

手繪筆記由 Tomomi Imura 繪製
人工智慧(Artificial Intelligence) 是一門研究「如何讓電腦表現出智慧行為」的學科 —— 也就是讓電腦去做那些人類擅長的事。
電腦最初是由 Charles Babbage 發明的,用來依照一套明確定義的程序(演算法)處理數字。現代電腦雖然遠比十九世紀的原型先進,骨子裡仍然遵循同一個想法:受控制的計算。因此,只要我們知道達成目標所需的確切步驟順序,就可以寫程式叫電腦去做。

照片由 Vickie Soshnikova 提供
✅ 「從照片判斷一個人的年齡」是一件無法用明確程式寫出來的事,因為我們自己也說不清楚腦中那個數字是怎麼跑出來的。
但有些事情,我們並不明確知道該怎麼解。想想「從照片判斷一個人的年齡」:我們不知怎地就學會了,因為看過大量不同年齡的人;可是我們既無法明確解釋自己是怎麼做到的,也就沒辦法寫成程式。這正是人工智慧(以下簡稱 AI)感興趣的那一類任務。
✅ 想幾件你可以交給電腦、而且會因為 AI 而受惠的任務。試著從金融、醫療與藝術這幾個領域想 —— 這些領域今天已經從 AI 得到什麼好處?
| 弱 AI(Weak AI) | 強 AI(Strong AI) |
|---|---|
| 為了單一任務或一小組任務而設計、訓練的 AI 系統。 | 又稱通用人工智慧(AGI),指具備人類等級的智慧與理解力的 AI 系統。 |
| 它們並非通用地聰明;在預先定義好的任務上表現出色,但缺乏真正的理解或意識。 | 能執行任何人類能做的智識任務、能跨領域適應,並具備某種形式的意識或自我覺察。 |
| 例子:Siri、Alexa 這類語音助理,串流平台的推薦演算法,以及為特定客服任務設計的聊天機器人。 | 達成強 AI 是 AI 研究的長期目標,需要能跨越各種任務與情境去推理、學習、理解與適應的系統。 |
| 弱 AI 高度專精,在它的窄領域之外並不具備類人的認知能力或通用問題解決能力。 | 強 AI 目前仍是理論概念,還沒有任何 AI 系統達到這種通用智慧的程度。 |
更多內容可參考 Artificial General Intelligence(AGI)。
處理**智慧** 這個詞的一大麻煩,是它沒有明確的定義。有人主張智慧和抽象思考有關,有人主張和自我覺察有關,但我們無法好好地把它定義出來。

照片由 Amber Kipp 提供,來源 Unsplash
想看看「智慧」這個詞有多曖昧,試著回答一個問題:「貓聰明嗎?」不同的人會給出不同的答案,因為並沒有一個普遍被接受的測驗能證明這個主張成立與否。如果你覺得有 —— 那就試著讓你家的貓去考一次 IQ 測驗吧。
✅ 花一分鐘想想你自己怎麼定義智慧。一隻能解開迷宮拿到食物的烏鴉算聰明嗎?一個小孩算聰明嗎?
談到 AGI,我們需要某種方法判斷「我們是不是真的做出了一個有智慧的系統」。Alan Turing 提出了 圖靈測試,它同時也扮演了一種智慧的定義。這個測試把待測系統拿去和一個本質上就有智慧的東西比較 —— 一個真人;而由於任何自動化的比較都可能被程式繞過,所以由人類來擔任提問者。若一個人在純文字對話中無法分辨對面是真人還是電腦系統,這個系統就被認為具有智慧。
一個在聖彼得堡開發、名叫 Eugene Goostman 的聊天機器人,在 2014 年靠一個聰明的人設技巧幾乎通過了圖靈測試:它一開始就宣稱自己是一名 13 歲的烏克蘭男孩,藉此解釋知識的不足與文句中的破綻。在 5 分鐘的對話後,它說服了 30% 的評審相信它是人類 —— 而圖靈當初認為機器要到 2000 年才能達到這個門檻。不過要理解的是,這並不表示我們造出了有智慧的系統,也不是電腦騙過了提問者:騙過人的不是系統,而是機器人的設計者。
✅ 你曾經被聊天機器人騙過、以為自己在跟真人講話嗎?它是怎麼說服你的?
如果我們希望電腦表現得像人,就得設法把人的思考方式模型化到電腦裡。也因此,我們得先試著理解:是什麼讓人具有智慧?
要把智慧寫進機器裡,我們得先理解自己的決策過程是怎麼運作的。稍微自我省察一下就會發現,有些過程是在潛意識中發生的 —— 例如我們不用思考就能分辨貓和狗 —— 而另一些則牽涉到推理。
面對這個問題有兩種可能的取徑:
| 由上而下(符號推理) | 由下而上(神經網路) |
|---|---|
| 由上而下的取徑模擬人推理解題的方式。它牽涉到從人身上萃取知識,並以電腦可讀的形式表示;我們也需要發展出在電腦中模擬推理的方法。 | 由下而上的取徑模擬人腦的結構 —— 由大量稱為神經元的簡單單元組成。每個神經元的行為就像其輸入的加權平均,而我們可以透過提供訓練資料來訓練一整個神經元網路去解決有用的問題。 |
此外還有其他可能的取徑:
突現(Emergent)、協同(Synergetic) 或多智能體(multi-agent) 取徑,建立在「複雜的智慧行為可以由大量簡單智能體的互動產生」這個事實上。依照演化控制論的說法,智慧可以在「超系統轉移」的過程中,從更簡單的反應式行為中突現出來。
演化取徑,或稱基因演算法,是一種以演化原理為基礎的最佳化過程。
這些取徑我們會在課程後面談到,現在先聚焦在兩個主要方向:由上而下與由下而上。
在由上而下的取徑裡,我們試著模擬自己的推理。因為推理時我們能夠追蹤自己的思路,所以可以試著把這個過程形式化,再寫進電腦。這稱為符號推理(symbolic reasoning)。
人的腦中往往有一些規則在引導決策。例如醫生在診斷病人時,可能會意識到「這個人在發燒」,因此體內可能有某處在發炎。把一大組規則套用到特定問題上,醫生就可能得出最終診斷。
這個取徑高度倚賴知識表示與推理。從人類專家身上萃取知識可能是最困難的部分,因為醫生在很多情況下並不確切知道自己為什麼會得出某個診斷 —— 有時候答案就這麼冒出來,並沒有經過明確的思考。而有些任務,例如從照片判斷年齡,根本無法化約成對知識的操作。
另一種做法,是試著模擬腦中最簡單的元件 —— 神經元。我們可以在電腦裡建構所謂的人工神經網路,再用範例去教它解決問題。這個過程很像新生兒透過觀察來認識周遭世界。
✅ 稍微查一下嬰兒是怎麼學習的。嬰兒大腦的基本元件有哪些?
那機器學習呢? 人工智慧中「以資料為基礎、讓電腦學會解決問題」的那一部分稱為機器學習。本課程不涵蓋古典機器學習,那部分請參考另一套教材 Machine Learning for Beginners。
人工智慧作為一個研究領域,始於二十世紀中葉。早期的主流取徑是符號推理,並帶來一些重要成果,例如專家系統 —— 能在有限問題領域內扮演專家的電腦程式。然而人們很快就發現,這種取徑的規模擴展性不好:從專家身上萃取知識、在電腦中表示它、再讓知識庫保持正確,是一件非常複雜的工作,在許多情況下昂貴到不切實際。這導致了 1970 年代所謂的 AI 寒冬。

圖片由 Dmitry Soshnikov 提供
隨著時間推移,運算資源變便宜、可用的資料變多,神經網路取徑開始在許多領域展現出足以和人類競爭的優異表現,例如電腦視覺與語音理解。過去十年間,「人工智慧」這個詞多半被當成神經網路的同義詞,因為我們聽到的 AI 成果大多以它為基礎。
以「會下西洋棋的程式」為例,可以清楚看到取徑是怎麼改變的:
✅ 查一下還有哪些遊戲被 AI 玩過。
同樣地,我們也能看到「會說話的程式」(有機會通過圖靈測試的那種)其取徑如何改變:

圖片由 Dmitry Soshnikov 製作,照片由 Marina Abrosimova 提供,來源 Unsplash
神經網路研究近年的巨大成長大約始於 2010 年,當時大型公開資料集開始出現。一個名為 ImageNet、包含約 1400 萬張標註圖片的龐大集合,催生了 ImageNet 大規模視覺辨識挑戰賽。

圖片由 Dmitry Soshnikov 提供
2012 年,卷積神經網路首次被用於影像分類,使分類錯誤率大幅下降(從將近 30% 降到 16.4%)。2015 年,來自 Microsoft Research 的 ResNet 架構達到了人類水準的準確率。
此後,神經網路在許多任務上都展現出非常成功的表現:
| 年份 | 達到人類水準的任務 |
|---|---|
| 2015 | 影像分類 |
| 2016 | 對話語音辨識 |
| 2018 | 自動機器翻譯(中譯英) |
| 2020 | 影像描述生成 |
過去幾年,我們也見證了 BERT、GPT-3 等大型語言模型的巨大成功。這主要是因為可用的一般文字資料非常多,讓我們得以訓練模型去捕捉文字的結構與意義:先在通用文字集合上預訓練,再針對更特定的任務做專門化。課程後面的自然語言處理章節會再深入。
上網逛一圈,找出你認為 AI 被運用得最有效的地方。是地圖應用程式?某個語音轉文字服務?還是一款電子遊戲?研究一下這個系統是怎麼被打造出來的。
閱讀 ML-For-Beginners 的這一課,複習 AI 與 ML 的歷史。從那一課或本課開頭的手繪筆記中挑一個元素,深入研究它,理解形塑其演變的文化脈絡。
內容來源:本頁譯自 Microsoft 的開源課程
AI For Beginners,原文連結:https://github.com/microsoft/AI-For-Beginners/blob/main/lessons/1-Intro/README.mdMIT License, Copyright (c) Microsoft Corporation。
本頁為碼力獅社群的中文翻譯與整理,非 Microsoft 官方版本;
內容如與原文有出入,以原文為準。程式碼範例與 Notebook 請直接使用原始 repo。