Skip to content

docs(ai): 논문용 실증 연구 — 통계 재분석·판정자 패널·지연 실험·양자화 연구 - #238

Merged
i3months merged 12 commits into
devfrom
research/thesis-stats
Sep 18, 2026
Merged

i3months merged 12 commits into
devfrom
research/thesis-stats

Conversation

@i3months

Copy link
Copy Markdown
Member

변경 사항

로컬 LLM 전환 연구를 논문 수준으로 끌어올리기 위한 실증 자료와 평가 도구. 코드 변경은 평가 하네스(ai/scripts/llm_eval/)에 한정되며 서비스 코드는 건드리지 않았다.

새 연구 문서 (docs/research/thesis/)

문서 내용
related-work.md 선행연구 12절 정리, 연구 공백 8가지
research-design.md RQ1~RQ7, 가설, 분석 계획, 대체 가능성 판정 기준
outline.md 논문 목차 초안과 장별 자료 대응표
stats/round1-stats.md, stats/round2-stats.md 기존 데이터 재분석 (부트스트랩 CI·Wilcoxon·Holm·검정력)
judge-panel-analysis.md 3계열 판정자 패널, Krippendorff α 0.715, 같은 계열 편향 +0.43 [0.27, 0.58]
label-verification.md LLM 2차 주석자 정답 라벨 검증 (의도 κ 1.000)
latency-experiment.md 개방형 Poisson 부하 — 프리픽스 캐시 필수성, 처리 용량 경계, J/token
tokenizer-efficiency.md 한국어 토크나이저 효율 최대 1.66배 차이
quantization-study.md 신규 비트 곡선·한국어 보정 행렬·재양자화 손실
human-eval/ 인간 평가 키트 (블라인드 라벨 시트, 루브릭, 절차)

양자화 연구 주요 결과

  • 8비트 → 3비트 구간에서 과제 지표가 사실상 불변 (점수 라벨 정확도 5개 조건 모두 70.4%)
  • 2비트에서 구조화 출력 붕괴. 같은 파일 크기(1.55 GiB) 3종 대조:
제작 방법 평균 KL 질문 풀 성공
한국어 보정 행렬 0.337 93.3%
보정 없음 0.739 33.3%
Q4에서 재양자화 0.776 0%
  • 같은 메모리라면 큰 모델을 강하게 줄이는 쪽이 유리 (26B 2비트 > 4B 8비트), 단 지연 2.3배
  • KL 발산과 과제 지표의 순위 상관 −0.68 ~ −0.93, 선형이 아닌 문턱형

도구 추가·확장 (ai/scripts/llm_eval/)

  • stats.py 부트스트랩·Wilcoxon·Holm·κ·ICC·검정력, judge_bias.py·judge_panel.py 혼합모형 편향 추정
  • latency_bench.py 개방형 부하, load_test.py 폐쇄형 동시성, label_annotate.py 블라인드 2차 주석
  • cases_v2.py 70케이스(꼬리질문 40·질문 풀 15·코칭 15), judge.py 판정 순서 통제·같은 계열 제외 패널

원자료

quant/(KL 원문·모델 출력·자동 지표), judges/, latency/, human-eval/ 에 재현용 원자료 포함.

확인 사항

  • 서비스 코드·설정 변경 없음, 문서와 연구 스크립트만 추가
  • 판정자 평가 일부는 게이트웨이 채점 키 크레딧 소진으로 미완 (새 키 확보 후 이어서 진행)

🤖 Generated with Claude Code

- stats.py: 케이스 단위 클러스터 부트스트랩 CI, 기준 대비 Wilcoxon·rank-biserial·Holm,
  판정자 신뢰도(Spearman·가중 κ·ICC), 계열 편향 추정, 검정력(필요 케이스 수), Wilson CI
- cases_v2.py: v1 22건을 포함한 확장 세트(꼬리질문 40·질문 풀 15·코칭 15), LLM_EVAL_CASES 로 선택
- judge.py: --judges(판정자 선택), --orderings(시드 순서+역순), 후보 위치·출력 길이 기록,
  점수 전 채점 근거(rationale), 질문 풀 판정에 JD·집중 영역 노출, 호출별 재현 가능한 순서
- run_eval.py: 질문 풀에 target_company/JD/focus_areas 전달
- research-design.md: 연구 질문 7개·가설·변수·분석 계획·판단 기준·타당도 위협을 결과 전에 고정
- tokenizer-efficiency.md: 11개 토크나이저의 한국어 토큰 수 (구어체 답변에서 최대 1.66배 차이)
- human-eval/: 정답 라벨 독립 검증 시트(블라인드·조정용), 전문가 품질 평가 설계
- latency_bench.py: 운영 꼬리질문 프롬프트로 Poisson 개방형 부하, TTFT·TPOT·토큰 간 지연·goodput
- Qwen3 4B 10종 KL 발산 측정: 8→3비트 평평, 2비트에서 급격 악화
- 같은 크기 2비트 3종 대조: 한국어 보정 0.337 vs 보정없음 0.739 vs 재양자화 0.776
- 과제 지표 15조건: 3비트까지 규칙 준수 불변, 2비트에서 구조화 출력 붕괴
- KL↔지표 스피어만 -0.68~-0.93, 문턱형
@i3months
i3months merged commit 5705d11 into dev Sep 18, 2026
4 checks passed
@i3months
i3months deleted the research/thesis-stats branch September 18, 2026 01:37
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant