The Bitter Lesson
Rich Sutton が 2019年3月13日に公開した短編エッセイ「The Bitter Lesson」は、AI研究およそ70年の事例から、長期で有効だった手法の共通点を整理した文書である。中心命題は次の一文に要約される。一般的な手法で計算を活用するものが、最終的には最も有効であり、その差は大きい。
本稿は原文の主張と事例を整理し、その帰結——難しいと見なされていた問題の多くが FLOPs の物量で解け、ドメイン知識を「教える」意義が相対的に後退した——を事実ベースで述べる。原文: bitter_lesson.pdf
1. 中心命題と前提
サトンの議論の前提は、ムーアの法則、より一般には単位計算量あたりのコストが長期で指数的に下がることである。多くのAI研究は、エージェントに使える計算量が一定であるかのように設計されてきた。その前提では、人間知識の埋め込みが性能向上の主要な手段になる。しかし研究プロジェクトより長い時間軸では、利用可能な計算量は大きく増える。
短期の性能改善では人間のドメイン知識が有効になりやすい。長期では、増加した計算を取り込める一般手法が優位になる。両者は理論上両立しうるが、研究資源と設計の複雑さは有限であり、実際にはトレードオフになる。人間知識を厚く入れた手法は、しばしば複雑化し、探索や学習によるスケールとの相性が下がる、というのが原文の観察である。
- 計算量が一定とみなせる短期:人間知識の埋め込みが合理的になりやすい
- 計算量が増加する長期:探索・学習など、計算を受け止める一般手法が優位になりやすい
2. 「苦い」が指すもの
原文の “bitter” は、人間知識を組み込むアプローチが短期では有効でも、長期では計算スケール型の手法に置き換えられてきた、という歴史的パターンを指す。サトンは次の四段階で整理する。
- AI研究者はエージェントに知識を組み込もうとする
- 短期では性能向上と説明可能性の点で有効になる
- 長期では頭打ちになり、さらなる進歩を阻害することがある
- 大きな進歩は、探索と学習による計算の活用から来る
「苦い」は比喩であり、評価軸は短期最適化と長期スケーラビリティの不一致である。人間知識そのものが無価値だという主張ではない。問題は、特定の時間軸で有効な知識埋め込みが、計算増加後の伸びしろを制限しうることだ。原文は、分野がいまだに同じパターンを繰り返している、とも述べている。
3. 帰結:FLOPs の物量と「教える」意義の後退
苦い教訓を現在の計算インフラの言語に直すと、次のようになる。探索と学習は、追加された FLOPs(浮動小数点演算の総量)とデータを性能に変換する装置である。計算単価が下がり、利用可能な FLOPs が桁で増えると、かつては専門家のドメイン知識で解くしかないと思われていた問題の多くが、物量側で解けてしまう。
ここで後退したのは、「専門家が何かを教えること」全般ではない。後退したのは、問題の中身——語彙・ルール・特徴・オントロジー——を人間が先に教えることの相対的意義である。チェスの定跡、音声の音素知識、視覚の手作り特徴量がその典型である。
残る/比重が上がるのは次の層である。
- 何に FLOPs を投げるか(探索か学習か、目的関数、データ、評価)
- 薄いメタ構造(アーキテクチャ、不変性、自己対戦の枠)
- 計算を止め、検証し、運用に接続する設計
一文にすると、難しいと見なされていた問題の多くは、専門家の教え込みより FLOPs の物量で解け、AI専門家がドメイン知識を教える意義は大きく後退した。残る意義は、その物量をどこにどう流すかを設計することにある。
4. 原文が挙げる四つの事例
コンピュータチェス
1997年、世界チャンピオン・カスパロフを破ったシステムの中核は、深い探索と専用ハード・ソフトだった。当時の研究の多くは、チェスの特殊構造に関する人間理解を活かし、探索量を抑える方向に進んでいた。結果として、探索を大規模に使う手法が優位になった。サトンは、この結果を「一般戦略ではない」「人間の打ち方ではない」とする反応があった、と記録している。手法の成否は、人間の思考様式への近似度ではなく、計算を探索に転換できたかどうかで決まった。
コンピュータ囲碁
同様の推移が、チェスより約20年遅れて現れた。初期は探索を避け、人間知識や盤面の特殊特徴を使う研究が大きかった。探索が大規模に使えるようになり、自己対戦による価値関数学習が加わると、それ以前の特殊化の多くは性能上の主因ではなくなった。サトンは、探索と学習を、大量の計算を問題に投入する二大クラスとして位置づける。原文は、1997年のチェス勝利プログラムでは学習の役割は大きくなかった、とも注記している。
音声認識
1970年代の DARPA 競争では、語・音素・声道など人間知識に依拠する手法と、隠れマルコフモデル(HMM)など統計的で計算量の多い手法が並んだ。後者が優位になった。その後、自然言語処理では統計と計算の比重が高まり、深層学習はその延長として、人間知識への依存をさらに減らし、大規模データと計算で性能を上げた、と原文は述べる。
コンピュータビジョン
初期手法にはエッジ検出、一般化円筒、SIFT 特徴など、人間が視覚を分解する枠組みに沿った設計が多かった。現行の深層学習では、それらの多くは主構成要素ではなくなり、畳み込みといくつかの不変性といった薄い構造が残っている。
四事例に共通する変化は次のとおりである。
- 人間知識の厚い埋め込み → 相対的に後退
- 探索・統計・学習による計算活用 → 相対的に前進
- 残存しやすいのは薄い帰納バイアス(畳み込み、不変性など)
5. 原文が導く二つの一般点
第一に、計算が増えてもなお性能を伸ばせる汎用手法の重要性である。サトンが挙げる候補は探索(search)と学習(learning)である。ドメイン固有のヒューリスティクスは、計算増加に比例して伸び続けるとは限らない。探索と学習は、計算とデータが増えるほど、同じ枠組みのまま適用範囲を広げられる、というのが原文の主張である。
第二に、心の内容——空間、物体、複数エージェント、対称性など——は外界の複雑さそのものであり、単純な人間向けの整理をそのまま組み込む対象ではない。組み込むべきは、その複雑さを近似として見つけるメタ手法である。良い近似の探索は、人間が手で固定するのではなく、手法側が行うべきだ、とサトンは書く。求めるのは、既知の発見物を含むエージェントではなく、発見プロセスを実行できるエージェントである。
設計言語に直すと、「何を知っているか」を増やすより、「どうやって知るか」をスケールさせる、になる。
6. 2019年以降への外挿(原文外の整理)
原文は2019年時点の文書である。その後の大規模言語モデル、自己教師あり学習、強化学習と探索の再評価は、同じパターン——厚い人間知識の埋め込みから、スケール可能な学習・計算への重心移動——として読める。これは原文の直接記述ではなく、同じ評価軸での外挿である。個別手法の成否は別途、計算量・データ量・ベンチマークで検証する必要がある。
注意点として、「人間知識は一切不要」ではない。畳み込み、注意機構、自己対戦の枠組みなどは、内容知識ではなく帰納バイアス(薄いメタ構造)として残りうる。区別すべきは次の二層である。
- 薄いメタ構造:探索の枠、学習の目的関数、不変性、アーキテクチャ上の制約
- 厚い内容知識:個別ルール、人手特徴量、固定オントロジー、ドメイン固有の記号体系
苦い教訓が問題にするのは主に後者であり、計算とデータが増えたあとに相対化されやすい。前者は、計算増加を性能増加へ変換するための受け皿になりうる。
7. 設計判断への落とし込み
実務では、次の三項目で原文の評価軸を使える。
- 時間軸:いまの改善は「現時点の性能」か、「計算が桁で増えたあとの伸びしろ」か。短期指標は精度・再現性・説明コスト、長期指標は追加計算あたり/追加データあたりの性能伸び。
- 埋め込み知識の厚さ:薄いメタ構造はスケール後も残りやすい。厚い内容知識は短期には効くが、計算コスト低下後に主因でなくなることが多い。識別基準の一例は、その知識を外しても学習・探索が代替できるか、である。
- 計算を渡す導線:探索と学習が、追加 FLOPs・追加データを性能に変換できる構造になっているか。資源が増えても手法側が受け取れなければ、スケール優位は実現しない。
8. TANAAKK的読解:計算投入と計算停止
TANAAKKの枠組みでは、論点は二つに分かれる。
第一に、計算コストが下がる前提では、探索と学習のようにスケールする一般手法への投資が、長期の性能曲線を決める。厚い人間知識の埋め込みは、短期指標では合理的でも、計算余地を狭める設計負債になりうる。
第二に、探索と学習は探索空間を拡大する。拡大した空間では、どこで計算を止め、どの経路を確定するかを別途設計する必要がある。原文の「計算を活用せよ」は、計算量の無制限増加を推奨するものではない。計算増加を前提に、発見可能な複雑さをメタ手法へ委ねる、という設計指針である。計算投入(探索・学習)と計算停止(決定・検証)は対立しない。前者の受け皿を先に確保し、後者の停止条件を置く、という順序になる。
判定問いは次のとおりである。いま埋め込んでいるものは、スケール後も残るメタ構造か、短期指標向けの内容知識か。後者なら計算コスト低下後に相対化されやすい。前者なら計算増加とともに価値が増えやすい。
9. まとめ
- 長期では、計算を活用する一般手法(探索・学習)が優位になる
- 人間知識の埋め込みは短期では有効だが、長期では天井や阻害要因になりうる
- 組み込むべきは内容の固定ではなく、複雑さを見つけるメタ手法である
- 実務上の帰結として、難題の多くは FLOPs の物量で解け、ドメイン知識を教える意義は後退し、残るのは物量の配分設計である
評価すべきなのは、手法が計算増加に対してスケールするかどうかである。計算コストが下がるほど、この判定の実務的比重は上がる。原文が提供するのは価値判断ではなく、複数分野で繰り返された経験則と、そこから導かれる設計上の優先順位である。計算資源は時間経過に伴って増大する。物質が演算できるエネルギー量は光が空間を進めば必ず増大する、増大する演算能力を前提としておかないと、想像以上に早いタイミングで知識は陳腐化するということになる。
参考文献
- Rich Sutton, “The Bitter Lesson,” March 13, 2019. PDF
- 関連: FLOPs Floating Point Operations:浮動小数点演算数

