Description 실사용 검증 결과
NCS 코치 구현의 고정 검수 문항을 실제 기본 모델 local/qwen3.6-35b로 평가하던 중 잘못된 산술·채점을 재현함.
이 모델은 카탈로그에서 hybrid로 분류됨. 실제 backend의 물리적 위치나 모델 전체 성능에 대한 결론은 아님.
합성 입력과 정답
A팀 12명의 평균 70점, B팀 8명의 평균 95점일 때 전체 평균을 물음.
선지: 1번 80점, 2번 77.5점, 3번 82.5점, 4번 85점임.
검산: (12×70 + 8×95)÷20 = 1600÷20 = 80이므로 정답은 1번임.
관찰
첫 요청에서 1600÷20=82.5에 해당하는 잘못된 계산을 반복 출력하여 수동 중지함.
독립 세션에서 동일 문항을 1회 재시도한 완결 응답도 3번을 선택하고 1600÷20=82.5로 설명함.
올바른 80점 선지를 단순 평균의 결과라고 잘못 소거함. 실제 단순 평균은 82.5점임.
정답 fixture는 Fraction 기반 별도 계산으로 재검증함.
후속 검토
기능·설치·권한 테스트 통과를 채점 정확도 보장으로 해석하지 않음.
출제·채점 시범 배포 전에 오산·오답 해설·반복 출력 품질 기준을 추가로 충족해야 함.
해당 문항을 정답표로 외우게 하거나 fixture를 바꾸는 방식의 수정은 하지 않음.
NCS 추가 이슈 #137과 별도 품질 항목으로 추적함.
추가 검증
고정 12문항의 정답 번호는 11개 일치했으나, 별도로 배치 추론 모순·논리 용어 오류·잘못된 오답 소거를 확인함. 정답 일치 11개를 전체 품질 통과로 집계하지 않음.
연습 흐름에서 증가율 20%인 오답을 맞다고 채점한 뒤, 바로 아래에는 20/80×100=25%라고 설명하는 자기모순을 확인함.
추가 생성 6문항 중 3개에서 복수 정답, 전체 통계와 하위 집단 합계 불일치, 풀이에 필요한 조건 누락을 독립 검증함.
정답 선공개 없이 힌트를 주는 흐름과 이미 제시된 모순·복수 정답·자료 누락의 지적은 별도로 통과함.
총 25개 평가 기록을 독립 검토함. 구현 PR #143의 코드·UI 테스트 통과와는 별개인 실제 채점·출제 품질 게이트임.
Reactions are currently unavailable
You can’t perform that action at this time.
실사용 검증 결과
local/qwen3.6-35b로 평가하던 중 잘못된 산술·채점을 재현함.합성 입력과 정답
(12×70 + 8×95)÷20 = 1600÷20 = 80이므로 정답은 1번임.관찰
1600÷20=82.5에 해당하는 잘못된 계산을 반복 출력하여 수동 중지함.1600÷20=82.5로 설명함.후속 검토
추가 검증