クラウドなしでロボットは「考えられる」のか
Raspberry Pi 5一台の上で、リアルタイムに視覚・聴覚を持ち、環境に反応する自律ロボットを構築すると想像してみてください。クラウド依存ゼロ、超低遅延、データプライバシーは完全保証。これが エッジAI が切り開く世界です。
本記事では、Googleの LiteRT(オンデバイス推論ランタイム)と Gemma(軽量オープンモデル群)を組み合わせ、Raspberry Pi 5上で完全ローカル動作するLLMパイプラインの構成方法を解説します。Reachy Miniロボットのデモを例に取り上げますが、スマートカメラ、IoTデバイス、ローカルAIエージェントにもそのまま応用可能です。
根拠資料: Google Developers Blog - Mastering Edge AI on Raspberry Pi with LiteRT and Gemma
なぜこれが重要か これまで「ローカルLLM」は高性能GPUを積んだワークステーションの専売特許でした。しかしRaspberry Pi 5(実売1万円台)で毎秒9トークンのデコードが可能になったということは、エッジデバイス上で実用レベルのLLM推論が現実になったということです。国内の製造業・閉域網ロボット案件にも直接応用できるスペックです。

核心:LiteRT + Gemma の構成
LiteRTとは
LiteRTはGoogle AI Edgeチームが開発した 本番環境で実績のあるオンデバイス推論ランタイム です。クラシックMLモデルから最新LLMまで、CPU・GPU双方で最適化された実行とメモリ効率を提供します。特に LiteRT-LM というオーケストレーション層を通じて、Gemmaモデルを追加チューニングなしで即座にデプロイできます。
Gemma 4 E2B の性能(Raspberry Pi 5基準)
| 項目 | 数値 |
|---|---|
| Prefill速度 | 99 tokens/sec |
| Decode速度 | 9 tokens/sec |
| ピークメモリ | 1,432 MB |
| End-to-end生成速度 | 約27.3 chars/sec(約300 wpm) |
一般的な人間の話速が毎分150語(wpm)程度であることを考えると、このパイプラインは 人間の話速の約2倍 でテキストを生成します。リアルタイム音声・翻訳タスクには十分実用的です。
CPU vs GPU:どちらを使うべきか
Raspberry Pi 5のクアッドコアCortex-A76 CPUはFP32で約153.6 GFLOPS、INT8で最大約2.0 TOPSを叩き出します。一方VideoCore VII GPUは800MHz動作でFP32約76.8 GFLOPS、INT8約0.24 TOPSです。総演算量ではCPUが圧倒的 です。
ではなぜGPUを使うのか。それは ヘテロジニアス並列実行 のためです。ビジョン・オーディオモデルをGPUにオフロードすれば、CPUサイクルをLLM推論やパイプラインオーケストレーションといった高優先度タスクに温存できます。発熱と電力効率の面でも有利です。
LiteRTは WebGPU(Vulkan)バックエンド をML Drift経由でRaspberry Pi上でサポートします。MediaPipe、Ultralytics YOLO、Moonshineといった人気モデルがそのまま動作します。
Reachy Miniロボットのデュアルプロセッシングパイプライン
Reachy Miniデモはこのアーキテクチャを極限まで推し進めた事例です:
- ビジョンワークロード → GPU(WebGPU/Vulkan)へオフロード
- 言語推論(Gemma) → CPUに維持
- パイプラインオーケストレーション → CPUの残余サイクルで処理
これにより、カメラ入力 → 物体認識 → LLM判断 → 音声/行動出力まで すべてローカルでリアルタイム に動作します。クラウド往復遅延はゼロです。

実践:Raspberry Pi 5ですぐに動かす
1. LiteRT CLIのインストール
# 仮想環境内でのインストールを推奨します
pip install litert-cli
2. Gemma 4 E2Bモデルの実行
Hugging Faceトークンを環境変数で渡し、LiteRTコミュニティリポジトリからモデルを直接取得して実行します。
# Hugging Face認証トークンを設定
export HUGGING_FACE_HUB_TOKEN=<your_token>
# Gemma 4 E2Bモデルをローカルで実行
litert lm run \
--from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E2B-it.litertlm \
--attachment=image.jpg \
--prompt="You are Reachy Mini. Identify the main object in front of you, \
state its location (Left/Right/Center), and suggest head action in \
10 words or less."
--attachment で画像を渡せば ビジョン + 言語推論を一括処理 できます。これがローカルマルチモーダルエージェントの最小構成です。
3. AIコーディングエージェントとの連携
LiteRT CLIは CLIスキルとしてAIコーディングエージェント(例:Google Antigravity)に登録できます。そうすればエージェントがモデル変換 → 量子化 → ベンチマーク → 推論までのマルチステージワークフローを自律的にオーケストレーションします。完全オフライン音声翻訳機などもこの方式で構築可能です。
注意事項と限界
- メモリは依然として厳しいです。 Gemma 4 E2Bだけでもピーク1.4GBを消費します。Raspberry Pi 5の4GBモデルではOSや他プロセスを考慮すると余裕はほとんどありません。8GBモデルを推奨します。
- Decode 9 tokens/secは「読み取り速度」であり「思考速度」ではありません。 複雑なマルチステップ推論は体感で遅く感じられます。リアルタイム対話用途ならストリーミングUIと短い応答設計が必須です。
- GPUバックエンドはVulkan依存 があるため、カーネル/ドライバのバージョンに敏感です。配備先デバイスのMesa/Vulkanドライバを必ず固定してください。
- 量子化モデルは精度とのトレードオフ があります。本番投入前にドメイン特化の評価セットで必ず検証してください。
次のステップ学習方向
- LiteRT Hugging Face Community で自分のドメインに合った事前変換済みモデルを探してください。
- Hailo AI HAT+ 対応がまもなく追加されます。同じLiteRTワークフローでNPUアクセラレーションが使えるようになるため、今のうちにパイプラインを組んでおけばそのまま移行できます。
- 量子化(quantization)とベンチマークツールを習得すれば、モデルサイズと精度のスイートスポットを自分で見つけられます。

まとめ:「エッジでのLLM」はもう実験室の外に出ました
Raspberry Pi 5 + LiteRT + Gemmaの組み合わせは、クラウドなしでも実用に耐えるローカルLLM推論 が可能であることを示しています。Reachy Miniデモはその可能性を劇的に見せるショーケースに過ぎず、実際にはスマートカメラ、産業用検査ロボット、閉域網音声アシスタントなど、国内でも需要の多い領域にすぐ適用できます。
特に 閉域網・個人情報規制が厳しい国内SI環境 では「データがデバイス外に出ない」ことが決定的な強みになります。クラウドAPIコストも0円です。
あわせて読みたい記事
皆さんのRaspberry Pi + LiteRT + Gemmaプロジェクトがあれば、ぜひコミュニティで共有してください。特に国内の製造・ロボット環境での適用事例に興味があります。