들어가며: 벤치마크와 현실의 괴리
AI 에이전트를 만드는 일이 어려운 이유는 명확해요. 실제 세상은 벤치마크처럼 얌전하게 동작하지 않기 때문이죠.
API 호출이 깨졌을 때 복구하지 못하는 에이전트, 처음 보는 워크플로우를 만나면 멍하니 있는 에이전트는 사실 '도구를 쥐어준 자동완성기'에 불과해요. 여기서 진짜 에이전트로 넘어가려면 결국 데이터 문제를 풀어야 합니다.
- 소프트웨어 엔지니어링 트레이스
- 도구 사용 실패 케이스
- 멀티스텝 추론
- 검색(Retrieval)과 안전성
- 사용자 시뮬레이션 및 워크플로우 실행
NVIDIA Nemotron의 오픈 데이터 제품군은 바로 이 지점을 겨냥합니다. 최근 ICML에서 Nemotron 모델과 데이터셋을 인용한 논문이 약 145편에 달했다는 점은, 이 방향성이 학계에서도 검증되고 있다는 신호예요.
국내 SI/SW 환경에서도 비슷한 고민이 많아요. 사내 워크플로우 데이터는 민감해서 그대로 공개할 수 없고, 그렇다고 완전히 닫아두면 에이전트가 똑똑해질 기회가 사라지죠. 그래서 오픈 데이터 전략이 실무에서도 점점 더 중요해지고 있습니다.

오픈 웨이트만으로는 부족하다: 재현성의 진짜 조건
오픈 웨이트(Open Weights)는 분명 중요해요. 하지만 에이전트에게 가중치는 이야기의 절반일 뿐입니다.
재현성(Reproducibility)은 다음 요소들에 달려 있어요.
- 데이터셋: 어떤 데이터로 학습했는가
- 큐레이션 선택: 어떤 기준으로 필터링했는가
- 학습 레시피: 하이퍼파라미터, 스케줄, 커리큘럼
- 평가 방법: 무엇을 성공으로 정의했는가
에이전트 행동은 **검사 가능(inspectable)**해야 합니다. 모델이 도구를 호출하고, 워크플로우를 실행하고, 정보를 검색하고, 시스템 전반에 걸쳐 행동한다면, 개발자는 그 행동을 형성한 데이터를 이해할 수 있어야 하죠.
NVIDIA가 공개한 데이터 규모
- 10조 개 이상의 사전학습 토큰
- 수백만 개의 포스트트레이닝 샘플
- Nemotron-CC, Nemotron-CC-MATH, Nemotron Pretraining 등 다양한 컬렉션
이걸 표(table)로만 보면 사실 아무 의미가 없어요. 그래서 NVIDIA가 만든 게 Prompt Atlas입니다.

Prompt Atlas와 합성 페르소나: 실무 관점 정리
1. Nemotron Post-Training v3 Prompt Atlas
각 점(point)이 하나의 프롬프트 샘플이고, 데이터 믹스처의 실제 비율을 반영하도록 볼륨 샘플링된 인터랙티브 맵이에요.
| 기능 | 설명 | 실무 활용 |
|---|---|---|
| 색상 오버레이 | 데이터셋/파이프라인 단계/도메인/도구 사용별 분류 | 어떤 도메인이 부족한지 파악 |
| 필터 | 특정 조건으로 프롬프트 필터링 | 에러 케이스만 추출 |
| 줌인 | 의미적으로 유사한 프롬프트 클러스터 확인 | 대표 예시 검토 후 eval 셋 구축 |
2. Nemotron-Personas: '로컬' 품질의 중요성
여기서 재미있는 포인트가 있어요. 데이터 품질은 보편적이지 않고 지역적이라는 겁니다.
영어 인터넷 데이터로 학습한 독성 분류기는 한국어나 일본어의 적대적 메시지를 놓칠 수 있어요. 왜냐하면 한/일어에서는 공격성이 명시적 어휘가 아니라 존댓말 레벨에 인코딩되는 경우가 많거든요. 같은 신호, 다른 맥락이죠.
Nemotron-Personas는 NeMo Data Designer를 사용해 지역 인구통계/지리 통계를 반영한 합성 페르소나를 생성합니다. 목표는 실제 사람을 재현하는 게 아니라, 개발자가 자기 시스템이 정말로 서비스한다고 주장하는 사용자/언어/지역/직업을 반영하는지 테스트하게 돕는 거예요.
3. 합성 임계값(Synthetic Thresholds)
실무에서 반드시 기억해야 할 개념입니다. 합성 데이터는 리스크를 줄여주지만, 그라운딩·계보·큐레이션·평가·인간 판단의 필요성을 제거하지는 않아요.
- 무엇이 생성되었는가
- 무엇이 그라운딩되었는가
- 무엇이 리뷰되었는가
- 이 데이터가 무엇을 테스트하려는 것인가
이걸 문서화하지 않으면, 나중에 디버깅할 때 지옥을 맛봅니다.
관련 글: ADK Go 1.0 출시: 프로덕션급 AI 에이전트를 위한 구글의 공식 Go 프레임워크 — 에이전트 프레임워크 관점에서 함께 보면 좋아요.

결론: AI의 희소 자원은 토큰이 아니라 '조직 간 신뢰'다
이 글의 핵심 메시지를 한 줄로 요약하면 이거예요.
AI의 희소 자원은 토큰이 아니라 조직 간의 신뢰다. 합성 데이터는 그 신뢰를 쌓는 몇 안 되는 도구 중 하나다.
한국 개발 생태계에서의 적용 맥락
국내에서는 특히 금융/의료/공공 도메인에서 이 논리가 절실합니다. 원본 데이터는 규제 때문에 절대 못 여는데, 그렇다고 에이전트를 포기할 순 없죠. 합성 데이터 + 지역 페르소나 조합은 이런 환경에서 현실적인 우회로가 될 수 있어요. 다만 개인정보보호법, 가명정보 활용 가이드를 반드시 병행 검토하셔야 합니다.
주의사항 (비판적 시각)
- 합성 데이터를 **'공짜 정답'**으로 착각하면 안 됩니다. 오히려 문서화 부담이 늘어나요.
- Prompt Atlas 같은 시각화 도구는 편향을 보여줄 뿐 고쳐주지는 않습니다.
- 지역 페르소나도 결국 통계 기반이기 때문에, 소수 집단은 여전히 underrepresented 될 수 있어요.
다음 단계 학습 방향
- Hugging Face의 Nemotron 데이터 컬렉션을 직접 다운로드해서 토크나이저 레벨에서 살펴보기
- NeMo Data Designer로 소규모 합성 페르소나 파이프라인 직접 구축해보기
- 자사 도메인에서 synthetic threshold 문서화 템플릿 만들기
함께 보면 좋은 글
- FP8 양자화 모델, TensorRT로 실제 배포까지 한 번에 끝내기 (CLIP 실전 가이드) — 학습한 모델을 실제 서빙까지 끌고 가는 관점에서 이어집니다.
- ADK Go 1.0 출시: 프로덕션급 AI 에이전트를 위한 구글의 공식 Go 프레임워크
에이전트 잘 만드시고 계신가요? 데이터 파이프라인에서 막히면 그게 제일 큰 병목이더라고요. 화이팅입니다 🚀