
✍️ 이 글은 Hermes 텔레그램 AI 봇을 직접 사용하며 겪은 경험을 바탕으로 작성된 정보성 콘텐츠입니다. 데이터 출처: 직접 테스트 화면 캡처, EIA·공개 LLM 벤치마크 자료 참고 (기준일: 2026년 5월)
Hermes를 처음 세팅했을 때, 가장 고민됐던 게 바로 "어떤 LLM을 연결할까"였어요. 유료 API를 쓰자니 비용이 걸리고, 로컬로 돌리자니 품질이 걱정됐거든요. 그래서 그냥 둘 다 써봤어요. Gemini API랑 로컬 LLM(Gemma4)을 번갈아 프로바이더로 설정하면서 텔레그램 봇이 실제로 어떻게 반응하는지 비교해봤습니다.
결론부터 말하면 — 체감 차이가 생각보다 많이 났어요. 특히 로컬 LLM 쪽에서 예상 못 했던 문제가 몇 가지 터졌거든요.
🤖 Hermes가 뭐예요?
Hermes는 텔레그램 채널에서 AI 챗봇을 운영할 수 있게 해주는 봇 프레임워크예요. 단순히 메시지를 주고받는 게 아니라, 메뉴형 인터페이스로 기술 트렌드 요약·정보 검색·코드 작성 같은 기능을 구성할 수 있어요.
핵심은 "백엔드 LLM 프로바이더를 직접 선택할 수 있다"는 점이에요. Gemini API, OpenAI GPT, 또는 로컬에서 직접 돌리는 Ollama 모델까지 — 설정 파일에서 교체만 하면 봇이 연결하는 AI 엔진 자체가 바뀌어요. 자동차로 치면 차 외관은 그대로인데 엔진만 바꾸는 것과 같아요.
✅ Gemini를 프로바이더로 썼을 때
Gemini API를 연결했을 때는 전반적으로 쓸 만했어요. 텔레그램 채팅창에서 한국어로 말하면 한국어로, 영어로 말하면 영어로 응답이 왔고요. 대화 맥락도 제법 잘 이어받았어요. 메뉴에서 "1번"을 선택하면 "기술 트렌드 → AI/머신러닝 섹션"이라는 걸 문맥으로 이해하고 그에 맞는 내용을 가져오더라고요.
✅ 한국어 이해·응답 자연스럽게 유지됨
✅ 넘버 메뉴(1번, 2번) 선택 의도 파악 잘 됨
✅ 이전 대화 맥락 이어받기 안정적
✅ 응답 속도 빠름 (대부분 2~4초)
⚠️ API 키 발급 및 월 사용량 확인 필요
⚠️ 무료 티어 초과 시 비용 발생 (Gemini 1.5 Flash 기준 저렴한 편)
솔직히 "이 정도면 그냥 Gemini 쓰면 되는 거 아니야?"라는 생각도 들었어요. 응답 품질 자체는 기대보다 좋았고, Flash 모델은 무료 할당량도 넉넉한 편이라 가볍게 쓰기엔 부담이 없었거든요. 단점이라면 API 키를 유지·관리해야 한다는 점, 그리고 데이터가 구글 서버를 경유한다는 점이에요.
⚠️ 로컬 LLM(Gemma4)으로 바꿨더니… 먹통이 왔다
"데이터가 외부로 안 나가고 공짜잖아?" 이 두 가지 이유로 Ollama로 Gemma4를 돌려서 Hermes에 연결해봤어요. 그리고 꽤 당황스러운 상황들이 연달아 생겼습니다.

🔴 문제 1 — 메뉴 번호를 못 알아들어요
Hermes 봇이 "1. AI/머신러닝, 2. 바이오, 3. 웹/IT…" 이런 식으로 메뉴를 제시했는데, 제가 "1번"이라고 답하니까 봇이 이렇게 물어봤어요.
1. A list or sequence?
2. A specific item or numbered choice?
3. Something else entirely?"
한국어 대화 중에 돌연 영어로 "1번이 뭘 말하는 건가요?"라고 되묻는 거예요. Gemma4가 직전 대화의 메뉴 맥락을 이어받지 못하고 "1"이라는 숫자만 단독으로 해석하려 한 거예요. 사람으로 치면 방금 5가지 선택지를 제시해놓고 본인이 뭘 물어봤는지 잊어버린 거예요. 황당하기도 하고 웃기기도 했어요.
🔴 문제 2 — 언어가 멋대로 바뀌어요
가장 당황스러웠던 건 이거예요. 한국어로 대화하고 있었는데, 어느 시점에서 제가 "ai"라고 짧게 입력하니까 봇이 갑자기 이렇게 답해요.
한국어로 대화 중이었는데 갑자기 영어로 자기소개를 한 거예요. 게다가 "I am a large language model trained by Google"이라고 하는데 — Gemma4는 구글이 만든 모델이 맞긴 하지만, 이 문맥에서 이렇게 튀어나오는 게 어색하기 짝이 없었어요. 대화 흐름이 완전히 끊겼고, 한동안 봇이 응답 자체를 이상하게 내뱉는 먹통 상태가 이어졌어요.
🔴 문제 3 — "지금까지 대화가 이어진 게 맞니?" 하는 순간들
세 번째 문제는 대화 연속성 자체가 불안정하다는 거예요. 어느 순간 봇이 이전 맥락을 완전히 잊고 처음부터 다시 시작하는 것처럼 행동해요. Gemma4의 컨텍스트 윈도우 처리 방식이 Hermes의 대화 관리 로직과 충돌하거나, 로컬 서버(Ollama)의 응답 지연으로 타임아웃이 발생했을 가능성이 있어요. 어쨌든 실사용에서 신뢰하기 어려운 수준이었어요.
📊 Gemini vs 로컬 LLM(Gemma4) 한눈에 비교
| 항목 | Gemini (API) | Gemma4 (로컬) |
|---|---|---|
| 한국어 응답 안정성 | ✅ 안정적 | ❌ 영어 전환 발생 |
| 메뉴 번호 이해 | ✅ 맥락 이해 | ❌ 맥락 놓침 |
| 대화 연속성 | ✅ 잘 이어받음 | ⚠️ 불안정 |
| 응답 속도 | ✅ 빠름 (2~4초) | ⚠️ 기기 성능 의존 |
| 비용 | ⚠️ 사용량별 과금 | ✅ 무료 |
| 데이터 프라이버시 | ⚠️ 구글 서버 경유 | ✅ 로컬 처리 |
| Hermes 실사용 안정성 | ✅ 추천 | ❌ 추가 세팅 필요 |
단순하게 정리하면 이래요. Gemini는 "그냥 쓰면 된다"의 영역이고, 로컬 LLM은 "쓸 수 있게 만들어야 한다"의 영역이에요. Gemma4 자체가 나쁜 모델이 아니에요. 다만 Hermes처럼 대화 맥락 관리가 필요한 봇 환경에서는 아직 클라우드 모델 대비 핸들링이 까다로운 게 사실이에요. 로컬 LLM의 장점인 프라이버시와 무료 사용을 살리려면, 한국어 튜닝이 잘 된 모델을 고르거나 시스템 프롬프트를 정교하게 설정하는 작업이 선행되어야 해요.
💡 그럼 어떤 모델이 더 잘 맞을까? — 유료·무료 추천
💳 유료 API 모델 추천
비용을 어느 정도 감수하더라도 안정성과 품질이 우선이라면 아래 세 가지를 추천해요.
| 모델 | 제공사 | 특징 | 비용 수준 |
|---|---|---|---|
| Gemini 1.5 Flash | 무료 할당량 넉넉, 빠른 응답, 한국어 양호 | ★ 저렴 | |
| Claude Sonnet 4.6 | Anthropic | 한국어 자연스러움 최상위권, 맥락 유지력 강함 | ★★ 중간 |
| GPT-4o Mini | OpenAI | 가성비 좋은 GPT-4 계열, 범용성 높음 | ★ 저렴 |
| Gemini 1.5 Pro | 긴 문서 처리·코드 특화, 컨텍스트 100만 토큰 | ★★★ 비쌈 |
Hermes 같은 텔레그램 봇 용도라면 Claude Sonnet 4.6을 특히 추천해요. 한국어 대화에서 맥락을 잘 이어받고, 짧은 키워드 입력("1번", "ai")에도 문맥을 보고 의도를 정확히 파악하는 능력이 탁월해요. 다만 API 요금이 Flash 계열보다는 높으니 사용량을 체크하면서 써야 해요.
🆓 무료 로컬 LLM 모델 추천
프라이버시나 비용이 우선이라면 로컬 LLM을 포기하기보다, 좀 더 맞는 모델을 찾아보는 게 나아요. 특히 한국어 지원이 좋은 모델을 고르는 게 핵심이에요.
| 모델 | 파라미터 | 한국어 | 권장 RAM | 특징 |
|---|---|---|---|---|
| Qwen2.5 7B | 7B | ⭐⭐⭐⭐ | 8GB+ | 한국어 응답 안정성 가장 좋음, 맥락 유지 우수 |
| Llama 3.1 8B | 8B | ⭐⭐⭐ | 8GB+ | 범용성 높음, 영어 강세지만 한국어도 무난 |
| DeepSeek R1 7B | 7B | ⭐⭐⭐ | 8GB+ | 추론·코드 특화, 논리 흐름 필요한 대화에 강함 |
| Gemma4 E4B | 4B (MoE) | ⭐⭐ | 16GB+ | 이번 글의 주인공. 코드·영어엔 강하나 한국어 맥락 취약 |
| Mistral 7B | 7B | ⭐⭐ | 8GB+ | 가볍고 빠름, 영어 특화, 로컬 입문용으로 적합 |
Hermes처럼 메뉴·맥락 기반 대화 봇에 로컬 LLM을 연결하려면 시스템 프롬프트에 "항상 한국어로 응답할 것", "이전 메뉴 선택 맥락을 유지할 것"이라는 지시를 명시적으로 추가하는 게 중요해요. 이 설정 없이 로컬 모델을 연결하면 이번처럼 언어 전환과 맥락 소실 문제가 반복될 수 있어요.
🎯 결국 뭘 써야 할까?
🟢 안정적인 한국어 대화가 우선 → Gemini 1.5 Flash or Claude Sonnet
🟢 비용을 최소화하고 싶다 → Gemini Flash 무료 티어 → 초과 시 GPT-4o Mini
🟢 완전 로컬·프라이버시 우선 → Qwen2.5 7B (현재 한국어 로컬 중 가장 안정적)
🟢 코드·추론 위주 사용 → Gemma4 E4B or DeepSeek R1 (단, 한국어 시스템 프롬프트 필수)
🔴 Gemma4를 Hermes 봇에 그냥 연결하는 것 → 지금 당장은 비추천
Hermes를 쓰면서 느낀 건, LLM 선택이 "어떤 모델이 더 똑똑한가"의 싸움이 아니라는 거예요. 어떤 용도에, 어떤 인터페이스와 함께, 어떤 언어 환경에서 쓰느냐가 훨씬 중요해요. 로컬 LLM의 가능성은 분명히 있는데 아직 세팅 손이 많이 가는 게 사실이에요. 당분간은 Gemini Flash로 운영하면서 로컬 모델은 시스템 프롬프트를 잘 다듬어 보는 방향으로 실험을 이어갈 생각이에요.
로컬 LLM을 텔레그램 봇에 연결하는 건 아직 "될 것 같아서 해봤더니 생각보다 손이 많이 가는" 단계예요. Gemma4가 나쁜 모델이 아니라 Hermes 같은 환경에서 추가 설정 없이 그냥 꽂아 쓰기엔 아직 무리가 있는 거죠. 무료라는 매력이 분명히 있는 만큼, 시스템 프롬프트 최적화 결과도 나중에 공유해볼게요.
※ 이 글에서 소개된 모델 및 요금 정보는 2026년 5월 기준이며, 각 제공사 정책에 따라 변경될 수 있습니다.
'Ai 취미생활 > 시행착오' 카테고리의 다른 글
| 24만원으로 굴린 비트코인 자동매매 봇, 한 달간 13번 갈아엎은 기록 — 레모니 봇 개발기 (3) | 2026.06.08 |
|---|---|
| 클로드 코드로 티스토리 스킨 만들기 — 구글 애드센스 EEAT 정책까지 챙기는 법 (0) | 2026.05.31 |
| (실패기)동학개미 지표 대시보드 실패기... 공공데이터와 예탁원이 던진 함정들 (0) | 2026.05.21 |
| Hermes Agent란? Gemini AI 연동 설치 방법 완전 정복 (2026년 최신) (6) | 2026.05.20 |
| VS Code에서 Gemma 4 로컬 AI 쓰는 방법 - GitHub Copilot 없이 (0) | 2026.05.06 |