FLOPs Floating Point Operations:浮動小数点演算数

Decrypt history, Encrypt future™

FLOPs Floating Point Operations:浮動小数点演算数

「半導体回路の効率が低く、発電や送電の熱損失が大きい状態であっても、資本とインフラの“物量(力任せのスケール)”で汎用人工知能(AGI)や人工超知能(ASI)の領域に到達できるか」という議論において、最も重要な物理指標であり共通言語となるのが「FLOPs(Floating Point Operations:浮動小数点演算数)」です。

シリコンバレーの「スケール派」が推し進めるインフラ巨額投資は、電子回路の洗練や省電力化を待つのではなく、「FLOPsという計算の物理量を地球規模で圧倒的に積み上げ、知能を力任せに創出する」という試みです。

1. 「FLOPs」とは何か

FLOPs(Floating Point Operations)は、積和演算(A × B + C)をはじめとする浮動小数点計算の総数を示します。

  • FLOPs(演算総数): モデルを1回学習完了させるまでに消費した計算の総作業量。
  • FLOPS(1秒あたりの演算数): GPUやデータセンターの計算速度・処理能力。

AIの文脈において、知能のスケールを議論するうえで中心になるのは、「どれだけ巨大な演算総数(FLOPs)をモデルに流し込んだか」です。

標準的なTransformerモデル(Dense型)の学習において、必要な計算量 \(C\)(FLOPs)は、モデルのパラメータ数 \(N\) と、学習に使用したデータ量(トークン数) \(D\) を用いて、次の近似式で表されます。

\[C \approx 6ND\]

これは forward / backward のコストをまとめた経験的な近似であり、「知能の規模は、パラメータ数とデータ量の積(=総FLOPs)によって大きく規定される」という見方の出発点になります。

2. スケーリング法則(Scaling Laws)と「物量による知能の創出」

シリコンバレーのビッグテックが巨額のインフラ投資を断行する根拠のひとつが、実証されてきたスケーリング法則(Scaling Laws)です。

べき乗法則(Power Law)の継続

スケーリング法則によれば、モデルの予測誤差(Loss)は総FLOPsの増加に伴って、対数スケール上で滑らかに低下する傾向(Power Law)を示します。

重要なのは、FLOPsを10倍、100倍、1000倍と拡大しても、性能曲線がすぐには途切れず、連続的に改善し続ける局面が観察されてきた点です。

  1. Kaplan法則からChinchilla法則へ: 初期はパラメータ数の拡大が重視されましたが(Kaplan et al.)、その後 Hoffmann et al. の Chinchilla では、「固定FLOPs予算のもとではパラメータ数とトークン数を同程度にスケールさせる方が効率的」という配分が示されました。
  2. 過剰学習(Over-training)のトレンド: Llama 3 以降では、推論時の効率を高めるため、あえて Chinchilla 最適付近を超えた膨大なトークン量を学習段階で投入する手法が広がっています。

創発的能力(Emergent Abilities)とFLOPsの閾値

FLOPsを投入し続けると、特定の計算量付近(例: \(10^{24}\) 〜 \(10^{26}\) FLOPs)で、単なる言語補完を超えた複雑な論理推論、プログラミング、数学的解法、マルチステップ計画などの能力が急に目立つようになる、という報告があります(創発的能力)。

これは「相転移」のように見える場合もありますが、測定指標や評価設計に依存する面もあり、厳密な物理的相転移と同定できるわけではありません。それでも現場の仮説としては、「回路構造が泥臭く非効率であっても、計算量(FLOPs)を十分に高めれば高度な知的振る舞いが現れる」という読みが、現代のスケール投資を支えています。

3. 「非効率なハードウェア」を「圧倒的物量」で補填する構図

人間の脳と、現代のシリコン半導体+電力インフラを比較すると、熱効率・エネルギー効率の差は極めて大きいです。

  • 人間の脳: 消費電力 約20W程度で、高度な自律思考と柔軟な適応を実現。
  • AIデータセンター: 大規模GPUクラスタを駆動し、膨大なFLOPsを処理するために、施設単位で数百MW〜数GW級の電力を消費。

半導体の回路内部では、トランジスタのスイッチングに伴う漏れ電流や熱によってエネルギーの多くが失われます。発電所からデータセンターへの送電、AC/DC変換、液冷ポンプや冷却設備に至るまで、熱損失の連鎖が存在します。

しかし Meta をはじめとするビッグテックのスケール投資が示唆するのは、「システム全体の変換効率が低くても、投入するエネルギーと計算リソースの絶対量を桁違いに増やせば、アウトプットされる知能の総量は脳を超えうる」という力技の肯定です。

比較項目 脳 ビッグテックインフラ
エネルギー効率 極めて高い(〜20W) 極めて低い(数百MW〜GWクラス)
演算速度(FLOPS) 非常に遅い(シナプス伝達はミリ秒単位) 極めて速い(ペタFLOPS / エクサFLOPS)
知能創出のロジック 最適化されたバイオ構造 圧倒的な計算量(FLOPs)の累積
拡張性(Scalability) 脳の容積・生体限界により固定 資本と電力(物量)により拡張可能

生物は長い進化を経て超省電力なアルゴリズムを獲得しましたが、人間はその構造を完全には解明・再現できていません。

一方で、人間はエネルギーとシリコンを投入して膨大なFLOPsを生み出す工業力をすでに持っています。「効率的な脳を作る」のを待つより、「非効率でも巨大な計算機を街ひとつ分建てる」方が、AGI/ASI到達への物理的な近道になりうる、というのがスケール派の論理です。

4. FLOPsの「2つの軸」:Training FLOPs から Inference FLOPs へ

物量によってAGI/ASIを賄う議論において、近年の重要な変化は「計算量をどのタイミングで投入するか」です。

Training FLOPs(事前学習時の計算量)

モデルのパラメータを最適化するために投入されるFLOPsです。

  • スケールの推移: GPT-2(2019年)はおおよそ \(10^{21}\) FLOPs 規模とされ、GPT-4クラス(2023年)は Epoch AI の推定で約 \(2\times10^{25}\) FLOPs 前後に達しています。次世代フロンティアモデルでは \(10^{26}\) 〜 \(10^{27}\) FLOPs 超が視野に入っています。
  • 限界: 事前学習のFLOPsを増やすだけでは、未知の難問に対する「思考力」の伸びが鈍化し始める局面も指摘されています。

Inference FLOPs(推論時の計算量 / Test-Time Compute)

モデルが回答を出力する際、思考チェーン(Chain of Thought)の生成や検索・検証に費やすFLOPsです。

  • 思考時間のスケール: 「テスト時計算量(Test-Time Compute)」とも呼ばれ、回答前に意図的に長く「考えさせる」ことで、推論時のFLOPsを引き上げます。
  • 小規模モデルによる逆転現象: 事前学習FLOPsが比較的小さなモデル(例: 7B〜70Bパラメータ)であっても、推論時に大量のFLOPsを投入することで、事前学習FLOPsだけで押したより巨大なモデルの論理的正確性を上回る場合があります。

この Inference-time Scaling(推論時スケーリング)により、「学習時だけでなく、運用時にも物量(FLOPs)を投下し続けることで、知能の質を高められる」ことが明確になりました。ASI的な思考力の実現は、二重の意味でFLOPsの物量投入に依存することになります。

5. 「物量押し」がぶつかる物理的壁と、ASIによる「自己ループ」

FLOPsを力任せに増やしてASIに到達するアプローチは理論上魅力的ですが、現実の物理世界ではいくつかの巨大な壁に直面します。

データ壁(Data Wall)と高品質合成データ

高品質な人間由来のテキストデータ(Web上の文章や書籍)は、すでに \(10^{25}\) FLOPs 前後の学習段階で逼迫しつつあります。

このため、次のスケール(\(10^{26}\) FLOPs〜)に進むには、AI自体に高品質な合成データ(Synthetic Data)を生成させ、それを別のAIに学習させる、FLOPsを介した自給自足のサイクルが重要になります。

電力・送電・熱の壁(Energy & Grid Limits)

単一のデータセンターでギガワット(GW)クラスの電力を消費しようとすると、送電網の周波数変動や瞬間的な負荷スパイク(数十〜数百MW)が系統全体のリスクになります。

これが、MetaやMicrosoft、Amazon、OpenAIなどが専用の原子力発電所や次世代地熱、ギガワット級の独立電源インフラの確保に動いている直接の理由です。

ASIによる「自己補正」のゲームプラン

物量戦略を投資論として読むと、次のような段階になります。

  1. 第1段階(力押し): 発電効率や電子回路の効率が悪くても、原発・送電網・巨額のシリコン(GPU)を投入し、圧倒的な総FLOPsで「不完全だが超高度な知能(準ASI)」を強引に生成する。
  2. 第2段階(自己革新): 誕生した準ASIに、半導体設計の最適化、冷却改善、新たな計算アーキテクチャ、次世代電源設計などを担当させる。
  3. 第3段階(効率の爆発): ASI自らが電子回路や熱効率の悪さを原理から改善し、次世代のFLOPs生成効率を桁違いに引き上げる。

つまり、最初から洗練されたスマートな回路を目指すのではなく、非効率なインフラを物量で押し切り、知能の閾値を一瞬でも突破させてしまえば、あとはその知能自身が物理的非効率さを解消してくれる、という読みが、現在のFLOPsインフラ巨額投資の狙いと言えます。

6. FLOPsが書き換える「知能」の定義

「現在の電子回路や発電効率の悪さのままでも、物量でおおよそのスーパーインテリジェンス性を賄えるか?」という問いに対する実務的な答えは、「イエスに近く、かつそれが現在進行形で試されている最も現実的なアプローチのひとつである」となります。

理論上のエレガントさ(省電力な脳型回路)を追求するアプローチは、解明と実用化に長い年月を要する可能性があります。一方で、「FLOPsの総数を力任せに積み上げる」というアプローチは、電力と資本とシリコンを投下すれば、比較的確実に知能の曲線を上に押し上げることができます。

スケール派にとって「効率の悪さ」は決定的な欠点ではなく、「十分な資本とインフラ投資(物量)によって吸収可能な過渡期の摩擦」です。累積FLOPsという指標の前では、多くの非効率さは計算可能なコストの問題へと還元されます。

参考文献

  1. Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361
  2. Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models (Chinchilla). arXiv:2203.15556
  3. Meta AI (2024). The Llama 3 Herd of Models. arXiv:2407.21783
  4. Epoch AI. GPT-4 training compute estimates(約 \(2.1\times10^{25}\) FLOP). epoch.ai/models/gpt-4-mar-2023 / models over 1e25 FLOP
  5. Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682
  6. OpenAI (2024). Learning to Reason with LLMs(test-time compute / o1). openai.com/index/learning-to-reason-with-llms/