クラウドなしでロボットは「考えられる」のか

Raspberry Pi 5一台の上で、リアルタイムに視覚・聴覚を持ち、環境に反応する自律ロボットを構築すると想像してみてください。クラウド依存ゼロ、超低遅延、データプライバシーは完全保証。これが エッジAI が切り開く世界です。

本記事では、Googleの LiteRT(オンデバイス推論ランタイム)と Gemma(軽量オープンモデル群)を組み合わせ、Raspberry Pi 5上で完全ローカル動作するLLMパイプラインの構成方法を解説します。Reachy Miniロボットのデモを例に取り上げますが、スマートカメラ、IoTデバイス、ローカルAIエージェントにもそのまま応用可能です。

根拠資料: Google Developers Blog - Mastering Edge AI on Raspberry Pi with LiteRT and Gemma

なぜこれが重要か これまで「ローカルLLM」は高性能GPUを積んだワークステーションの専売特許でした。しかしRaspberry Pi 5(実売1万円台)で毎秒9トークンのデコードが可能になったということは、エッジデバイス上で実用レベルのLLM推論が現実になったということです。国内の製造業・閉域網ロボット案件にも直接応用できるスペックです。

Reachy Mini robot powered by Gemma and LiteRT running locally on Raspberry Pi 5 Dev Environment Setup

核心:LiteRT + Gemma の構成

LiteRTとは

LiteRTはGoogle AI Edgeチームが開発した 本番環境で実績のあるオンデバイス推論ランタイム です。クラシックMLモデルから最新LLMまで、CPU・GPU双方で最適化された実行とメモリ効率を提供します。特に LiteRT-LM というオーケストレーション層を通じて、Gemmaモデルを追加チューニングなしで即座にデプロイできます。

Gemma 4 E2B の性能(Raspberry Pi 5基準)

項目数値
Prefill速度99 tokens/sec
Decode速度9 tokens/sec
ピークメモリ1,432 MB
End-to-end生成速度約27.3 chars/sec(約300 wpm)

一般的な人間の話速が毎分150語(wpm)程度であることを考えると、このパイプラインは 人間の話速の約2倍 でテキストを生成します。リアルタイム音声・翻訳タスクには十分実用的です。

CPU vs GPU:どちらを使うべきか

Raspberry Pi 5のクアッドコアCortex-A76 CPUはFP32で約153.6 GFLOPS、INT8で最大約2.0 TOPSを叩き出します。一方VideoCore VII GPUは800MHz動作でFP32約76.8 GFLOPS、INT8約0.24 TOPSです。総演算量ではCPUが圧倒的 です。

ではなぜGPUを使うのか。それは ヘテロジニアス並列実行 のためです。ビジョン・オーディオモデルをGPUにオフロードすれば、CPUサイクルをLLM推論やパイプラインオーケストレーションといった高優先度タスクに温存できます。発熱と電力効率の面でも有利です。

LiteRTは WebGPU(Vulkan)バックエンド をML Drift経由でRaspberry Pi上でサポートします。MediaPipe、Ultralytics YOLO、Moonshineといった人気モデルがそのまま動作します。

Reachy Miniロボットのデュアルプロセッシングパイプライン

Reachy Miniデモはこのアーキテクチャを極限まで推し進めた事例です:

  1. ビジョンワークロード → GPU(WebGPU/Vulkan)へオフロード
  2. 言語推論(Gemma) → CPUに維持
  3. パイプラインオーケストレーション → CPUの残余サイクルで処理

これにより、カメラ入力 → 物体認識 → LLM判断 → 音声/行動出力まで すべてローカルでリアルタイム に動作します。クラウド往復遅延はゼロです。

Raspberry Pi 5 board running LiteRT CLI for on-device LLM inference with Gemma models Technical Structure Concept

実践:Raspberry Pi 5ですぐに動かす

1. LiteRT CLIのインストール

# 仮想環境内でのインストールを推奨します
pip install litert-cli

2. Gemma 4 E2Bモデルの実行

Hugging Faceトークンを環境変数で渡し、LiteRTコミュニティリポジトリからモデルを直接取得して実行します。

# Hugging Face認証トークンを設定
export HUGGING_FACE_HUB_TOKEN=<your_token>

# Gemma 4 E2Bモデルをローカルで実行
litert lm run \
  --from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
  gemma-4-E2B-it.litertlm \
  --attachment=image.jpg \
  --prompt="You are Reachy Mini. Identify the main object in front of you, \
state its location (Left/Right/Center), and suggest head action in \
10 words or less."

--attachment で画像を渡せば ビジョン + 言語推論を一括処理 できます。これがローカルマルチモーダルエージェントの最小構成です。

3. AIコーディングエージェントとの連携

LiteRT CLIは CLIスキルとしてAIコーディングエージェント(例:Google Antigravity)に登録できます。そうすればエージェントがモデル変換 → 量子化 → ベンチマーク → 推論までのマルチステージワークフローを自律的にオーケストレーションします。完全オフライン音声翻訳機などもこの方式で構築可能です。

注意事項と限界

  • メモリは依然として厳しいです。 Gemma 4 E2Bだけでもピーク1.4GBを消費します。Raspberry Pi 5の4GBモデルではOSや他プロセスを考慮すると余裕はほとんどありません。8GBモデルを推奨します。
  • Decode 9 tokens/secは「読み取り速度」であり「思考速度」ではありません。 複雑なマルチステップ推論は体感で遅く感じられます。リアルタイム対話用途ならストリーミングUIと短い応答設計が必須です。
  • GPUバックエンドはVulkan依存 があるため、カーネル/ドライバのバージョンに敏感です。配備先デバイスのMesa/Vulkanドライバを必ず固定してください。
  • 量子化モデルは精度とのトレードオフ があります。本番投入前にドメイン特化の評価セットで必ず検証してください。

次のステップ学習方向

  1. LiteRT Hugging Face Community で自分のドメインに合った事前変換済みモデルを探してください。
  2. Hailo AI HAT+ 対応がまもなく追加されます。同じLiteRTワークフローでNPUアクセラレーションが使えるようになるため、今のうちにパイプラインを組んでおけばそのまま移行できます。
  3. 量子化(quantization)とベンチマークツールを習得すれば、モデルサイズと精度のスイートスポットを自分で見つけられます。

Developer terminal executing LiteRT CLI commands to run Gemma 4 E2B LLM offline on Raspberry Pi Software Concept Art

まとめ:「エッジでのLLM」はもう実験室の外に出ました

Raspberry Pi 5 + LiteRT + Gemmaの組み合わせは、クラウドなしでも実用に耐えるローカルLLM推論 が可能であることを示しています。Reachy Miniデモはその可能性を劇的に見せるショーケースに過ぎず、実際にはスマートカメラ、産業用検査ロボット、閉域網音声アシスタントなど、国内でも需要の多い領域にすぐ適用できます。

特に 閉域網・個人情報規制が厳しい国内SI環境 では「データがデバイス外に出ない」ことが決定的な強みになります。クラウドAPIコストも0円です。

あわせて読みたい記事

皆さんのRaspberry Pi + LiteRT + Gemmaプロジェクトがあれば、ぜひコミュニティで共有してください。特に国内の製造・ロボット環境での適用事例に興味があります。

本コンテンツは、信頼性の高い情報源をもとにAIツールを活用して作成され、編集者によるレビューを経て公開されています。専門家によるアドバイスの代替となるものではありません。