Korean MT-Bench 문항, 모델 응답, LLM-as-a-Judge 판정 기록 및 논문 결과 재현 코드
benchmark reproducible-research korean-nlp large-language-models llm-evaluation llm-as-a-judge mt-bench korean-mt-bench
-
Updated
Aug 25, 2026 - Python