diff --git a/docs/research/thesis/outline.md b/docs/research/thesis/outline.md index a7dbb99..4f9f5dc 100644 --- a/docs/research/thesis/outline.md +++ b/docs/research/thesis/outline.md @@ -12,7 +12,7 @@ | 1.1 배경 | 생성형 AI 모의면접의 확산, 클라우드 LLM 의존의 비용·데이터 통제·가용성 문제 | 선행연구 §2 (PolyInterview, Aka et al.), **운영 사고: 게이트웨이 월 사용량 소진으로 AI 기능 중단(2026-09-17)** | ✅ | | 1.2 연구 문제 | 로컬/오픈 모델로 어느 과제까지 대체 가능한가 | `research-design.md` §2 | ✅ | | 1.3 연구 질문 | RQ1~RQ7 | `research-design.md` §3 | ✅ | -| 1.4 기여 | ① 한국어 면접 3과제 × 로컬 모델 품질·지연·동시성 결합 실측 ② 제약 GPU 에서 배칭 무효 영역과 프리필 병목 규명 ③ 한국어 과제 기준 양자화·재양자화·보정 언어 영향 ④ 한국어 토크나이저 효율의 지연 영향 ⑤ LLM 판정자 계열 편향의 품질 통제 추정 ⑥ 재사용 가능한 평가 하네스 공개 | 전체 | 🔄 | +| 1.4 기여 | ① 한국어 면접 3과제 × 로컬 모델 품질·지연·동시성 결합 실측 ② 제약 GPU 에서 배칭 무효 영역과 프리필 병목 규명 ③ 한국어 과제 기준 양자화·재양자화·보정 언어 영향 ④ 한국어 토크나이저 효율의 지연 영향 ⑤ LLM 판정자 계열 편향의 품질 통제 추정 ⑥ 재사용 가능한 평가 하네스 공개 | 전체 | 🔄 (③②④ 확보, ①⑤ 판정 대기) | ## 2장. 관련 연구 @@ -41,24 +41,24 @@ |---|---|---|---| | 4.1 하드웨어·서빙 환경 | GTX 1660 Ti 80W, llama.cpp, 컨테이너 격리 | 2라운드 리포트 §3 | ✅ | | 4.2 후보 모델 선정 | 크기·라이선스·한국어 근거 | 1·2라운드 리서치 | ✅ | -| 4.3 테스트 케이스 | v2 70건, 생성 주체 공개, 인간 라벨 검증 | `cases_v2.py`, `human-eval/gold-label-*.csv` | 🔄 (라벨 검증 ⏳) | +| 4.3 테스트 케이스 | v2 70건, 생성 주체 공개, 라벨 독립 검증 | `cases_v2.py`, `label-verification.md` | ✅ (LLM 2차 주석자 κ 1.0, 인간 검증 미실시) | | 4.4 자동 지표 | 태그·JSON 준수, 의도·점수 라벨, 사실대조, 근거 인용 | `analyze.py` | ✅ | -| 4.5 블라인드 판정 | 3계열 판정자, 순서 2회, 같은 계열 제외 패널 | `judge.py` | 🔄 (판정 실행 ⏳ 키 필요) | +| 4.5 블라인드 판정 | 3계열 판정자, 순서 2회, 같은 계열 제외 패널 | `judge.py`, `judge-panel-analysis.md` | 🔄 (양자화 12/40 케이스에서 채점 키 소진) | | 4.6 인간 평가 | 전문가 3인, 60~80 출력 | `human-eval/README.md` | ⏳ | -| 4.7 성능 측정 | 개방형 Poisson 부하, 60초×3~5회, TTFT·TPOT·goodput, GPU 원격 측정 | `latency_bench.py`, `load_test.py` | 🔄 | -| 4.8 양자화 측정 | KL 발산, imatrix·재양자화 설계 | 서버 스크립트 | 🔄 | +| 4.7 성능 측정 | 개방형 Poisson 부하, 60초×3회, TTFT·TPOT·goodput, GPU 원격 측정 | `latency_bench.py`, `load_test.py` | ✅ | +| 4.8 양자화 측정 | KL 발산, 한국어 imatrix·재양자화 설계, 16조건 스윕 | `quantization-study.md` §1 | ✅ | | 4.9 통계 분석 | 부트스트랩 CI, Wilcoxon·TOST·Holm, 혼합모형, 검정력 | `stats.py`, `judge_bias.py` | ✅ (도구) | ## 5장. 결과 | 절 | RQ | 현재 근거 (탐색) | 확증에 필요한 것 | 상태 | |---|---|---|---|---| -| 5.1 품질 | RQ1 | 소형 모델 유의하게 낮음(Holm p<0.02), 26B-A4B 차이 비유의 | v2 케이스 + 3계열 판정, TOST | 🔄 | -| 5.2 규칙 준수·의도 분류 | RQ4 | Gemma E4B 96%·100%, Qwen3 4B 100%·58%, Mi:dm 14% | v2 케이스 Wilson CI | 🔄 | -| 5.3 양자화 | RQ2 | IQ3_S 26B-A4B 품질 유지, Q4→Q2 재양자화 붕괴 | 비트 곡선·KL·imatrix 비교 | 🔄 | -| 5.4 서빙 병목·동시성 | RQ3 | 프리필 ~240 tok/s 설정 무관, 병렬 +16%, 전력 캡 39% | 개방형 부하·캐시 on/off | 🔄 | -| 5.5 토크나이저 | RQ5 | 구어체 최대 1.66배 차이 | 실측 TTFT 회귀 | 🔄 | -| 5.6 판정자 편향 | RQ6 | 같은 계열 대형 모델 +0.57 [0.36, 0.78] | 3계열 판정 + 인간 평가 | ⏳ | +| 5.1 품질 | RQ1 | 소형 모델 유의하게 낮음(Holm p<0.02), 26B-A4B 차이 비유의. 계열 제외 패널 점수 확보 | v2 케이스 전체 판정(채점 키 대기), TOST | 🔄 | +| 5.2 규칙 준수·의도 분류 | RQ4 | v2 70케이스로 16조건 측정 완료. 태그 준수·의도·점수 라벨·사실대조 전부 집계 | 게이트웨이 모델 v2 재측정(운영 키 외 필요) | 🔄 | +| 5.3 양자화 | RQ2 | **완료** — 비트 곡선 10종 KL, 한국어 보정 효과(0.739→0.337), 재양자화 손실, 크기 의존성 | — | ✅ `quantization-study.md` | +| 5.4 서빙 병목·동시성 | RQ3 | **완료** — 개방형 Poisson 부하, 프리픽스 캐시 필수성, 처리 용량 경계(0.6 req/s), J/token | — | ✅ `latency-experiment.md` | +| 5.5 토크나이저 | RQ5 | 구어체 최대 1.66배 차이, 부하 실험의 입력 토큰 실측치 확보 | 토큰 수 → TTFT 회귀 분석 | 🔄 | +| 5.6 판정자 편향 | RQ6 | 3계열 패널 α 0.715, 같은 계열 편향 +0.43 [0.27, 0.58], 양자화 판정에서도 재현 | 인간 평가(평가자 필요) | 🔄 | | 5.7 비용 | RQ7 | 손익분기 월 2,400~5,500 세션 | 민감도 분석 | ✅ (모형) | ## 6장. 논의 @@ -73,6 +73,16 @@ - 요약, 실무 권고(현 시점 클라우드 유지 + 대비책), 향후: 24GB GPU 실측, QLoRA 증류로 소형 모델 과제 특화, 로컬–클라우드 라우팅, 인간 평가 확대 +## 남은 작업 (2026-09-18 기준) + +| 순위 | 작업 | 막힌 이유 | 없으면 | +|---|---|---|---| +| 1 | 양자화 판정 나머지 28케이스 (163회 호출) | 게이트웨이 채점 키 크레딧 소진 | 5.3절은 규칙 지표만으로 서술 가능, 5.1 은 약해짐 | +| 2 | 게이트웨이 모델(Gemini·Gemma 31B 등) v2 케이스 재측정 | 실험 전용 키 필요 | 1·2라운드 v1 결과로 대체 서술 | +| 3 | 인간 전문가 평가 3인 | 평가자 섭외 | 5.6절이 LLM 판정자 간 비교에 머무름 | +| 4 | 토큰 수 → TTFT 회귀 | 없음 (분석만 하면 됨) | 5.5절이 토크나이저 계산에 머무름 | +| 5 | 24GB GPU 실측 | 하드웨어 없음 | 6.1절 경계 주장이 추정으로 남음 | + ## 부록 - A. 프롬프트 전문 · B. 케이스 목록과 라벨 · C. 판정 루브릭 · D. 전체 결과 표 · E. 재현 명령 · F. 운영 사고 기록