Skip to content

docs(ai): 로컬 LLM 전환 심층 조사 리포트(md·pdf) + 동시성 부하 도구 - #237

Merged
i3months merged 2 commits into
devfrom
research/local-llm-deep-dive
Sep 17, 2026
Merged

i3months merged 2 commits into
devfrom
research/local-llm-deep-dive

Conversation

@i3months

Copy link
Copy Markdown
Member

작업 내용

  • docs/research/local-llm-deep-dive-2026-09/local-llm-deep-dive.md + 같은 위치 PDF — 로컬 LLM 전환 심층 리서치·실험 리포트
  • docs/research/local-llm-deep-dive-2026-09/data/ — 원시 결과, 자동 지표, 블라인드 판정(44건), GPU 원격 측정 5,260건, 적재 로그 (무효 측정 2건은 파일명에 INVALID)
  • ai/scripts/llm_eval/load_test.py — 동시 사용자 부하 테스트 (동시 1/2/4/8명, 피드백 fan-out 중 꼬리질문)
  • ai/scripts/llm_eval/run_eval.py --constrain-json — 질문 풀·코칭 JSON 스키마 강제
  • 결정용 보고서·docs 인덱스에 링크

변경 이유 / 배경

1차 비교 실험의 "로컬 LLM 비권장" 결론이 설정(Ollama 직렬 처리)·오래된 서빙·작은 모델 선택 때문인지, 하드웨어 한계인지 가려내기 위함.

결과 요약

  • 현 GPU(GTX 1660 Ti 6GB) 프롬프트 처리 ~240 tok/s 는 설정·서빙 무관 (하드웨어 한계). 병렬 슬롯은 첫 토큰만 앞당기고 처리량은 +16%. 부하 구간 39% 가 80W 전력 상한
  • 피드백 생성 중 다른 사용자 꼬리질문: Gemini 1.6s vs 로컬 최선(Gemma 4 E2B) 24s
  • 품질(Claude 판정, 꼬리질문): Gemini Flash-Lite 4.07 / Gemma 4 26B-A4B 3비트 3.71 / 4B급 이하 최고 3.00
  • Gemma 4 26B-A4B 는 3비트에서도 질문 풀 4.2·코칭 4.3 으로 Gemini 동급 → 로컬은 24GB+ GPU 결정
  • 최신 llama.cpp 에서 Kanana-2-3B 깨진 출력은 해결됐으나 품질 최하위, Mi:dm 은 여전히 DONT_KNOW 편향, Gemma 4 E2B/E4B 동작
  • JSON 스키마 강제: 파싱 90→100% 지만 내용 품질은 하락
  • GPU 끊김(무경고 CPU 폴백) 오늘 3회, 모두 배포 후 1~15분 — NVIDIA toolkit daemon-reload 이슈로 추정, 대책 정리

테스트

  • flake8 / black, AI 단위 테스트 399 passed
  • 운영 서버 별도 테스트 컨테이너(메모리 상한)에서 실측, 사이트 헬스체크 전 구간 정상

영향 범위

  • DB 마이그레이션: 없음
  • API contract 변경: 없음
  • 환경변수 추가/변경: 없음
  • 런타임 코드 변경 없음 (스크립트·문서)

리뷰어 체크포인트

  • 권고 §6: 로컬 추진 시 구매 전 GPU 임대로 Gemma 4 26B-A4B Q4/FP8 실측, 공유 Ollama GPU 끊김 대책은 서버 관리자와 조율 필요
  • 서버에 모델 파일 ~65GB(/home/stackup/llm-models)와 llama.cpp 이미지가 남아 있음 — 정리 여부 결정 필요

🤖 Generated with Claude Code

1차 비교 실험의 "로컬 비권장" 결론이 설정·서빙·모델 선택 한계인지 하드웨어 한계인지 검증.

- docs/research/local-llm-deep-dive-2026-09: 리포트(md·pdf), 원시 결과, 자동 지표, 블라인드 판정,
  GPU 원격 측정 5,260건, 적재 로그 (무효 측정 2건은 파일명에 INVALID 표기)
- 결과 요약: 현 GPU 프롬프트 처리 ~240 tok/s 로 설정 무관(하드웨어 한계), 병렬 슬롯은 처리량 +16% 에 그침,
  4B급 이하 품질 최고 3.0, Gemma 4 26B-A4B 는 3비트에서도 Gemini 근접 → 로컬은 24GB+ GPU 결정
- ai/scripts/llm_eval: load_test.py(동시 사용자 부하), run_eval.py --constrain-json(JSON 스키마 강제)
@i3months
i3months merged commit 387b8e8 into dev Sep 17, 2026
5 checks passed
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant