Skip to content

docs(ai): LLM 제공자 비교 실험 리포트 총정리 - #236

Merged
i3months merged 3 commits into
devfrom
docs/llm-experiment-report
Sep 18, 2026
Merged

i3months merged 3 commits into
devfrom
docs/llm-experiment-report

Conversation

@i3months

Copy link
Copy Markdown
Member

작업 내용

  • docs/research/llm-eval-2026-09/experiment-report.md 추가 — LLM 제공자 비교 실험 전체 리포트
    • 배경과 질문, 실험 환경, 운영 부하 기준값(집계만), 후보 선정 근거
    • 케이스 22개·라벨 정의, 지연·동시성 시나리오, 자동 지표 정의, 블라인드 판정 방법
    • 결과: 판정자별·축별·케이스별 품질, 형식 준수·채점 신뢰도, 지연·동시성·콜드스타트, GPU 적재
    • 실험 중 발견: CUDA 초기화 실패 무경고 CPU 폴백, num_ctx 4096 절단, thinking 제어, Kanana-2 출력 깨짐
    • 비용 추정, 종합 평가, 권고·운영 코드 개선 후보, 한계, 진행 기록(검증된 시각만), 재현 명령, 출력 예시
  • 결정용 보고서와 docs/README.md 인덱스에 링크 추가

변경 이유 / 배경

#235 의 결정용 보고서는 회의 안건 요약이라, 실험 설계·세부 수치·사고 기록까지 한 곳에서 검토·재현할 수 있는 리포트가 필요.

테스트

  • 모든 수치를 docs/research/llm-eval-2026-09/ 의 원시 데이터·판정 결과에서 재계산해 대조
  • 진행 기록 시각은 git·PR 메타데이터, Ollama 로그, API 응답 타임스탬프로 확인한 값만 사용

영향 범위

  • DB 마이그레이션: 없음
  • API contract 변경: 없음
  • 환경변수 추가/변경: 없음
  • 문서만 변경

리뷰어 체크포인트

  • §9 의 운영 코드 개선 후보(AnswerEvaluation null 처리, 질문 풀 체인 재시도)는 이번 실험에서 드러난 것으로, 별도 이슈로 다룰지 판단 필요

🤖 Generated with Claude Code

결정용 보고서(llm-provider-evaluation-2026-09.md)와 별개로, 실험 전체를 재현·검토할 수 있게 정리.

- 배경·환경(하드웨어, Ollama 설정, 운영 부하 기준값)·후보 선정 근거(웹 리서치 요약)
- 케이스 22개와 라벨 정의, 지연·동시성 시나리오, 자동 지표·블라인드 판정 방법
- 판정자별·축별·케이스별 품질, 형식 준수, 지연·동시성·콜드스타트, GPU 적재
- 실험 중 발견: CUDA 초기화 실패 무경고 CPU 폴백, num_ctx 4096 절단, thinking 제어,
  Kanana-2 출력 깨짐, 1차 예비 측정
- 비용 추정, 종합 평가, 권고·운영 코드 개선 후보, 한계, 검증된 시각만 쓴 진행 기록, 재현 명령, 출력 예시
@i3months
i3months merged commit 1097bc7 into dev Sep 18, 2026
4 checks passed
@i3months
i3months deleted the docs/llm-experiment-report branch September 18, 2026 01:36
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant