Cloudflare の Workers AI は「エッジで LLM が動く」と短く紹介されることが多いが、実態はもう少し入り組んでいる。GPU の物理配置、モデル weights の配信経路、コールドスタートの挙動、リージョナル routing のロジック。公開ドキュメントと筆者の実測を照らし合わせ、推論 1 リクエストが通る「道筋」を描き直す。
『エッジで LLM が動く』というフレーズは、Workers AI の入り口を正しく伝えるが、その奥行きを省きすぎている。2026 年現在、Workers AI の GPU は全リージョンに均等配置されているわけではなく、実際には「主要リージョン (NRT / DFW / FRA / LHR 他) に GPU プールを厚く、他リージョンからはそこへ routing」という階層構造を取る。
推論 1 リクエストが通る道筋
Workers Runtime で `env.AI.run('@cf/meta/llama-3', {...})` が呼ばれると、その Worker isolate はまず自身の AI Gateway バインディング経由で近傍 GPU プールへのリクエストを組み立てる。GPU プールの選定は static なハッシュでなく、ロードアベレージ + モデル warm 率 + 物理距離の三つ巴で決まる (ドキュメントには明示されていないが、実測では負荷が高いプールを明確に回避している)。
Workers AI は物理 GPU を完全に隠蔽するが、隠蔽の品質はプールの warm 率次第で大きくブレる— 林 陸 · Harbor Signal 記者
コールドスタートの実測
未使用のモデルで推論を開始すると、最初の 1 リクエストは 2-6 秒かかることがある。これは Worker の cold start ではなく、GPU 側でモデル weights を HBM にロードし直しているため。筆者が 2026-04 に行った実測では、`@cf/meta/llama-3-8b` で中央値 3.1 秒、95 パーセンタイル 5.8 秒のコールドスタートが観測された。同モデルへの 2 回目のリクエストは中央値 380ms に収束する。
AI Gateway を挟むとキャッシュ判定・レート制限・メトリクス収集の層が増え、トータルのレイテンシは 20-40ms 上がる。しかし複数モデル間の fallback / A-B テスト / cost tracking が一括で乗るので、production では AI Gateway 経由を推奨するのが Cloudflare 公式の立場だ。
今後の見どころ
2026 年後半の課題は、いかに GPU プールを「見えない」まま増強するか。Cloudflare は TPU / Trainium 系のサードパーティアクセラレータを混ぜ込む構想も示唆しており、Workers AI の API を同じに保ったまま裏側をハイブリッド化する路線が濃厚だ。Harbor Signal は引き続き実測で確かめていく。

