클라우드 없이 로봇이 '생각'할 수 있을까?
라즈베리파이 5 한 대에서 실시간으로 보고, 듣고, 반응하는 자율 로봇을 만든다고 상상해 보세요. 클라우드 의존성 제로, 초저지연, 데이터 프라이버시 100% 보장. 이게 바로 **엣지 AI(Edge AI)**가 여는 그림이에요.
이번 글에서는 Google의 LiteRT(온디바이스 추론 런타임)와 Gemma(경량 오픈 모델 패밀리)를 조합해서 라즈베리파이 5에서 완전 로컬로 돌아가는 LLM 파이프라인을 어떻게 구성하는지 살펴볼게요. Reachy Mini 로봇 데모를 예시로 들지만, 여러분의 스마트 카메라·IoT 기기·로컬 AI 에이전트에도 그대로 응용 가능합니다.
근거자료: Google Developers Blog - Mastering Edge AI on Raspberry Pi with LiteRT and Gemma
왜 이게 중요한가요? 그동안 '로컬 LLM'은 고사양 GPU가 있는 워크스테이션의 전유물이었어요. 그런데 라즈베리파이 5(가격 10만 원대)에서 초당 9토큰 디코딩이 나온다는 건, 엣지 디바이스에서 실사용 가능한 수준의 LLM 추론이 가능해졌다는 뜻입니다. 국내 SI/제조 환경에서도 폐쇄망 로봇·검사 장비에 바로 얹을 수 있는 스펙이에요.

핵심: LiteRT + Gemma 조합의 구조
LiteRT가 뭔가요?
LiteRT는 Google AI Edge 팀이 만든 프로덕션 검증된 온디바이스 추론 런타임이에요. 클래식 ML 모델부터 최신 LLM까지, CPU·GPU 양쪽에서 최적화된 실행과 메모리 효율을 제공합니다. 특히 LiteRT-LM이라는 오케스트레이션 레이어를 통해 Gemma 모델을 별도 튜닝 없이 바로 배포할 수 있어요.
Gemma 4 E2B 성능 (라즈베리파이 5 기준)
| 항목 | 수치 |
|---|---|
| Prefill 속도 | 99 tokens/sec |
| Decode 속도 | 9 tokens/sec |
| Peak 메모리 | 1,432 MB |
| End-to-end 생성 속도 | ~27.3 chars/sec (약 300 wpm) |
일반 사람의 말하기 속도가 분당 150단어(wpm) 정도인데, 이 파이프라인은 사람 말의 2배 속도로 텍스트를 뽑아냅니다. 실시간 음성·번역 태스크에 충분히 쓸 만하죠.
CPU vs GPU, 뭘 써야 하나?
라즈베리파이 5의 쿼드코어 Cortex-A76 CPU는 FP32 기준 ~153.6 GFLOPS, INT8 기준 최대 ~2.0 TOPS를 냅니다. 반면 VideoCore VII GPU는 800MHz에서 FP32 ~76.8 GFLOPS, INT8 ~0.24 TOPS 수준이에요. 연산 총량은 CPU가 압도적입니다.
그런데 왜 GPU를 쓰냐고요? 바로 이기종 병렬 실행(heterogeneous parallel execution) 때문이에요. 비전·오디오 모델을 GPU로 오프로드하면, CPU 사이클을 LLM 추론이나 파이프라인 오케스트레이션 같은 고우선순위 작업에 남겨둘 수 있습니다. 발열과 전력 효율 측면에서도 훨씬 유리해요.
LiteRT는 WebGPU(Vulkan) 백엔드를 ML Drift를 통해 라즈베리파이에서 지원합니다. MediaPipe, Ultralytics YOLO, Moonshine 같은 인기 모델들이 그대로 돌아가요.
Reachy Mini 로봇의 듀얼 프로세싱 파이프라인
Reachy Mini 데모는 이 아키텍처를 극단까지 밀어붙인 사례입니다:
- 비전 워크로드 → GPU(WebGPU/Vulkan)로 오프로드
- 언어 추론(Gemma) → CPU에 유지
- 파이프라인 오케스트레이션 → CPU 남은 사이클에서 처리
이렇게 하면 카메라 입력 → 객체 인식 → LLM 판단 → 음성/행동 출력까지 전부 로컬에서 실시간으로 돌아갑니다. 클라우드 왕복 지연이 0이에요.

실전: 라즈베리파이 5에서 바로 돌려보기
1. LiteRT CLI 설치
# 가상환경 안에서 설치하는 걸 권장합니다
pip install litert-cli
2. Gemma 4 E2B 모델 실행
Hugging Face 토큰을 환경변수로 넘기고, LiteRT 커뮤니티 저장소에서 모델을 바로 받아 실행합니다.
# Hugging Face 인증 토큰 설정
export HUGGING_FACE_HUB_TOKEN=<your_token>
# Gemma 4 E2B 모델을 로컬에서 실행
litert lm run \
--from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E2B-it.litertlm \
--attachment=image.jpg \
--prompt="You are Reachy Mini. Identify the main object in front of you, \
state its location (Left/Right/Center), and suggest head action in \
10 words or less."
--attachment로 이미지를 넘기면 비전 + 언어 추론을 한 번에 처리합니다. 이게 바로 로컬 멀티모달 에이전트의 최소 구성이에요.
3. AI 코딩 에이전트와 연동
LiteRT CLI는 CLI 스킬 형태로 AI 코딩 에이전트(예: Google Antigravity)에 등록할 수 있습니다. 그러면 에이전트가 알아서 모델 변환 → 양자화 → 벤치마크 → 추론까지 멀티스테이지 워크플로우를 자율적으로 오케스트레이션해요. 완전 오프라인 음성 번역기 같은 것도 이 방식으로 만들 수 있습니다.
주의사항 및 한계
- 메모리는 여전히 빡빡합니다. Gemma 4 E2B만 해도 피크 1.4GB를 먹어요. 라즈베리파이 5의 4GB 모델에서는 OS + 다른 프로세스 감안하면 여유가 크지 않습니다. 8GB 모델을 권장해요.
- Decode 9 tokens/sec는 '읽기 속도'지 '생각 속도'가 아닙니다. 복잡한 멀티스텝 추론은 체감상 느릴 수 있어요. 실시간 대화용이라면 스트리밍 UI와 짧은 응답 설계가 필수입니다.
- GPU 백엔드는 Vulkan 의존성이 있어서 커널/드라이버 버전에 민감합니다. 배포 대상 기기의 Mesa/Vulkan 드라이버를 반드시 고정하세요.
- 양자화 모델은 정확도 트레이드오프가 있습니다. 프로덕션에 넣기 전에 도메인 특화 평가셋으로 반드시 검증하세요.
다음 단계 학습 방향
- LiteRT Hugging Face Community에서 본인 도메인에 맞는 사전 변환 모델을 찾아보세요.
- Hailo AI HAT+ 지원이 곧 추가됩니다. 같은 LiteRT 워크플로우로 NPU 가속을 쓸 수 있게 되니, 지금 파이프라인을 짜두면 그대로 이전 가능해요.
- 양자화(quantization)와 벤치마크 도구를 익혀두면, 모델 크기와 정확도 사이의 sweet spot을 직접 찾을 수 있습니다.

정리: '엣지에서 LLM'은 이제 실험실 밖으로 나왔습니다
라즈베리파이 5 + LiteRT + Gemma 조합은 클라우드 없이도 쓸 만한 로컬 LLM 추론이 가능하다는 걸 보여줍니다. Reachy Mini 데모는 그 가능성을 극적으로 보여주는 쇼케이스일 뿐이고, 실제로는 스마트 카메라, 산업용 검사 로봇, 폐쇄망 음성 비서 등 국내에서도 수요가 많은 영역에 바로 적용할 수 있어요.
특히 폐쇄망·개인정보 규제가 강한 국내 SI 환경에서는 '데이터가 기기 밖으로 나가지 않는다'는 게 결정적입니다. 클라우드 API 비용도 0원이고요.
함께 보면 좋은 글
여러분의 라즈베리파이 + LiteRT + Gemma 프로젝트가 있다면 커뮤니티에 공유해 주세요. 특히 국내 제조·로봇 환경에서의 적용 사례가 궁금합니다 🙌