본문으로 건너뛰기
← Systems Notebook / AI
학습과 평가01 / 03

모델이 좋아졌다는 말에는 빠진 조건이 있다

학습할 문제를 고르는 일부터 pass@k, 정답 선택, 평가기의 오류와 회귀까지. 새 모델로 바꿀 근거를 따져봅니다.

홍범연구 기반 해설약 22분

모델을 학습시켜 정답률을 높였다면, 이제 새 모델로 바꿔도 될까요?

배포 담당자에게는 아직 필요한 정보가 남아 있습니다. 한 번에 답해야 하는 서비스인지, 여러 후보를 검사한 뒤 하나를 전달하는 서비스인지에 따라 선택이 달라질 수 있습니다. 실패한 답이 같은 실수를 반복하는지도 알아야 합니다. 평균 점수가 올랐더라도, 그동안 처리하던 특정 업무를 못 하게 됐다면 교체를 망설일 이유가 생깁니다.

이 문제를 이해하려면 학습법 이름보다 먼저 세 가지를 연결해야 합니다. 모델이 내는 답, 학습으로 바꾸려는 답의 분포, 그중 서비스가 사용자에게 전달하는 답입니다. 이 연결이 없으면 SFT, 강화학습, 증류는 방법의 목록으로 남고, 평가 점수는 선택의 근거가 되지 못합니다.

여기서는 네 문제에 답하는 두 가상 모델로 출발해, 학습 결과를 평가하고 다음 실험을 고르는 과정을 살펴보겠습니다. 예제의 확률과 계산은 설명을 위해 정한 값입니다. 연구 결과는 별도로 출처와 조건을 적었습니다.

학습으로 고칠 문제인지부터 확인하기

배포 문서를 읽는 모델이 예전 절차를 답하는 상황을 생각해 보겠습니다. 그 원인이 모델의 기억인지, 검색기가 예전 문서를 가져왔기 때문인지에 따라 첫 변경이 달라집니다. 최신 문서를 입력으로 주면 올바르게 답하는데 검색 단계에서만 실패한다면, 학습 전에 고칠 수 있는 지점이 이미 드러납니다.

저라면 같은 질문에 필요한 근거를 직접 제공한 조건과 현재 검색을 사용하는 조건부터 비교하겠습니다. 이 비교는 근거가 제대로 들어왔을 때 가능한 성능과 실제 검색을 거친 성능 사이의 차이를 보여줍니다. 전자는 운영 성능 점수가 아니라 검색 이후 단계를 진단하는 조건입니다. 답을 포함한 근거를 사람이 골라줬다면 그 추가 정보도 기록해야 합니다.

관찰한 실패 먼저 비교할 변경 변경 후 확인할 결과
최신 자료가 입력에 없습니다 검색·문서 갱신·필터 같은 질문에 적절한 버전의 근거가 들어오는가
자료가 있는데 출력 형식을 반복해서 어깁니다 지시·스키마 검증, 이후 SFT 검토 의미를 보존하면서 계약에 맞는 결과를 내는가
계산 과정에서 값을 잘못 처리합니다 계산 도구와 입력 검증 모델 설명과 도구가 계산한 값이 일치하는가
정답 후보가 있는데 최종 선택이 틀립니다 선택기·검사기 같은 후보 묶음에서 선택 실패가 줄어드는가
근거와 도구를 제공해도 특정 판단을 실패합니다 해당 스킬의 데이터·학습 새 표현과 자료에서도 같은 판단을 수행하는가

이 비교의 목적은 학습과 RAG 중 하나만 고르는 데 있지 않습니다. RAG는 검색한 외부 정보를 생성에 결합하는 구성이며, 검색기와 생성기를 학습하는 방식도 가능합니다. 중요한 것은 이번 실험에서 바꾸는 대상을 특정하는 일입니다. RAG 원 논문

예를 들어 최신 문서만 넣어도 해결되는 문제에서 모델·데이터·프롬프트를 한꺼번에 바꾸면 결과가 좋아져도 무엇이 기여했는지 알기 어렵습니다. 먼저 입력을 고정하고 변경 하나의 효과를 본 뒤 조합을 비교하면, 추가 학습이 필요한 이유도 더 구체적으로 설명할 수 있습니다.

한 번 잘 답하는 모델과 여러 문제에 가능성이 있는 모델

모델이 잘하는 문제와 답을 만들지 못하는 문제를 나누어 보기 위해 네 가지 과제를 비교하겠습니다. 문서에서 값을 찾는 과제, 두 수의 비율을 계산하는 과제, 배포 기록을 대조하는 과제, 근거가 부족한 질문에서 판단을 보류하는 과제입니다. 각 유형을 대표하는 문제를 하나씩 골랐다고 가정합니다. 실제 서비스의 유형별 성능을 측정한 표는 아닙니다.

같은 입력을 반복했을 때의 정답 확률 값 찾기 비율 계산 기록 대조 판단 보류
모델 A 90% 90% 0% 0%
모델 B 25% 25% 25% 25%

각 문제에 한 번씩 답하게 하면 A의 평균 정답률은 45%, B는 25%입니다. 한 번의 응답이 곧 최종 결과라면 A가 유리합니다. 다만 A는 뒤의 두 문제에서 정답을 전혀 만들지 못합니다. B는 첫 답이 불안정하지만 네 문제 모두에서 정답이 나올 가능성이 있습니다.

같은 문제에 여러 번 답할 기회를 주면 결과가 달라집니다. 정답 확률이 p이고, 같은 조건에서 서로 독립인 응답을 k개 생성한다고 가정하겠습니다. 모두 틀릴 확률은 (1-p)^k입니다. 따라서 정답이 하나 이상 포함될 확률은 다음과 같습니다.

정답이 하나 이상 포함될 확률 = 1 - (1 - p)^k

이 값을 문제별로 계산한 뒤 평균을 내면 다음 표를 얻습니다. 이 글에서는 이를 기대 pass@k로 부르겠습니다.

문제당 생성 횟수 k 모델 A 모델 B
1 45.00% 25.00%
2 49.50% 43.75%
4 50.00% 68.36%
8 50.00% 89.99%

A는 시도 횟수를 늘려도 50%를 넘을 수 없습니다. 이 예제에서 정답 확률이 0인 두 문제는 계속 0이기 때문입니다. B는 네 번의 기회를 받으면 A보다 더 많은 문제에서 정답 후보를 만듭니다. 모델을 평가하는 질문에 ‘몇 번 시도할 수 있는가’를 추가했을 뿐인데 순위가 바뀌었습니다.

여기서는 문제별 정답 확률을 각각 계산한 뒤 평균을 냅니다. A의 45%를 p로 사용하면, 네 문제 모두에서 성공 확률이 45%인 다른 모델을 계산하게 됩니다. 실제로 1-0.55^4는 약 90.85%입니다. 올바른 50.00%와 큰 차이가 납니다. 평균 하나가 문제별 실패의 구조를 지워버린 결과입니다.

또 한 가지를 구분해야 합니다. 위 표는 고정된 모델에서 생성 횟수를 늘린 결과입니다. 이 조건의 기대 pass@k는 k가 커진다고 내려가지 않습니다. 학습 전후에 같은 k의 점수가 달라지는 것은, 학습으로 모델의 응답 분포 자체가 바뀐 별개의 비교입니다.

정답 후보를 만들었다고 사용자에게 정답이 도착하지는 않는다

모델 B의 기대 pass@4가 68.36%라는 사실만으로 네 번 생성하는 서비스를 선택할 수는 없습니다. 서비스에는 정답 후보를 고르는 단계가 하나 더 필요합니다.

예를 들어 네 후보가 ‘A’, ‘A’, ‘A’, ‘B’이고 실제 정답이 B라면, 정답은 후보 안에 있습니다. pass@4는 이 문제를 성공으로 셉니다. 그러나 다수결은 A를 전달합니다. 긴 설명을 쓴 답을 우선하는 선택기도 같은 실수를 할 수 있습니다.

정답을 알고 평가하는 실험에서는 후보 중 하나라도 맞았는지 확인하기 쉽습니다. 실제 요청에서는 그 정답을 미리 갖고 있지 않은 경우가 많습니다. 그러므로 생성기의 가능성과 선택기의 능력을 따로 측정해야 합니다.

이를 사건으로 쓰면 관계가 명확해집니다. G는 ‘후보 묶음에 정답이 있다’, S는 ‘선택한 답이 정답이다’라고 하겠습니다. 선택기가 후보를 고르기만 하고 새 답을 만들지 않는다면 S는 G 안에서만 일어납니다.

최종 성공 확률 = P(G) × P(S | G)
               = 정답 포함 확률 × 정답이 있을 때 제대로 고르는 비율

앞의 B에서 선택기가 정답이 있는 묶음의 60%만 제대로 고른다고 가정하면, 최종 성공 확률은 68.36% × 60% ≈ 41.02%입니다. A의 한 번 응답 45%보다 낮습니다. 생성 횟수는 늘었지만 사용자가 받는 결과는 더 나빠졌습니다.

이 계산은 선택기 성능을 고정한 설명용 예입니다. 실제로는 문제 유형이나 후보 수가 바뀌면 선택기의 성공률도 달라집니다. 그래도 실패 원인을 진단할 때 필요한 구분은 유지됩니다. 정답이 후보 안에 없었는지, 있었는데도 선택하지 못했는지에 따라 바꿔야 할 대상이 달라집니다.

테스트 가능한 코드 생성에서는 후보를 실행해 고를 수 있습니다. 문서 질문에서는 인용한 구절이 주장 전체를 뒷받침하는지 확인해야 합니다. 어느 쪽이든 검사기가 확인하는 범위가 중요합니다. 일부 테스트를 통과한 코드와 실제 요구사항을 만족하는 코드는 서로 다를 수 있습니다. 검사기가 보지 못하는 오류를 후보 수 증가만으로 해결할 수는 없습니다.

계산해 보기

정답 후보가 최종 답이 되기까지

본문에서 가정한 모델 B를 사용합니다. 같은 분포에서 응답을 독립적으로 생성하고, 선택기는 그 후보 중 하나를 고릅니다.

생성 횟수 k

4회 생성: 정답 포함 68.36% × 선택 성공 60% = 최종 성공 41.02%. A의 한 번 응답은 45.00%입니다.

k가 바뀌어도 선택 성공률을 유지한다고 가정한 계산입니다. 실제 모델·선택기의 성능 예측은 아닙니다.

학습은 어떤 신호를 이용해 답의 분포를 바꾸는가

생성 단계와 선택 단계의 실패를 나누었다면, 학습으로 어느 쪽을 개선하려는지도 정할 수 있습니다. 배포할 때 한 번에 안정적으로 답하는 모델이 필요하다면, 여러 후보 안에서 가끔 나오는 좋은 답을 더 자주 나오게 하는 변화도 충분히 가치 있습니다. 지금 전혀 풀리지 않는 문제에 답하는 능력이 필요하다면 다른 변화가 필요할 수 있습니다. 이 목표를 정하지 않고 학습법부터 고르면, 좋아진 점수와 해결하려던 문제가 어긋나기 쉽습니다.

같은 오류를 세 가지 신호로 다루어 보겠습니다. A 상품은 100에서 120으로, B 상품은 50에서 70으로 늘었습니다. ‘증가율이 높은 상품’을 묻는데 학생 모델이 ‘120이 더 크므로 A’라고 답했습니다. 필요한 수정은 값의 크기와 증가율을 구분하는 것입니다.

SFT에서는 목표 응답을 준비합니다. 예를 들어 ‘A는 20/100=20%, B는 20/50=40%이므로 B’라는 답을 줍니다. 모델은 정해진 앞부분을 보고 이어지는 목표 토큰을 더 높은 확률로 예측하도록 학습합니다. 이 사례에서 제공하는 것은 정답 B만이 아니라, 비교 기준을 바꾸고 분모를 선택하는 응답의 형태입니다.

다만 좋은 해설을 읽는 것과 스스로 잘못 시작한 답을 복구하는 것은 다른 상황입니다. 목표 응답을 따라 학습할 때는 앞부분에 이미 올바른 비교 기준이 놓여 있습니다. 실제 생성에서는 모델이 ‘120이 더 크므로’까지 진행한 상태를 만날 수 있습니다. 평가할 때는 모범 풀이를 이어 쓰는 능력과 독립적으로 올바르게 출발하는 능력을 구분해야 합니다.

최종 정답 보상을 사용하는 RLVR에서는 학생이 직접 답을 만듭니다. 답 B에 보상 1, 답 A에 보상 0을 주는 식입니다. 이렇게 하면 학생이 실제로 생성하는 경로를 대상으로 학습할 수 있습니다. 대신 최종 답의 정오만으로는 ‘증가분은 맞았지만 분모를 잘못 골랐다’와 ‘문제를 읽지 않고 찍었다’를 직접 구분해 알려주기 어렵습니다. 이것이 이 예제에서 말하는 피드백의 희소성입니다.

후보가 전부 틀릴 때는 정답 보상만으로 어느 경로를 더 밀어줄지 구별하기도 어렵습니다. 그렇다고 모든 RL이 학습을 멈춘다는 뜻은 아닙니다. 탐색, 보상 설계, 초기 모델과 알고리즘에 따라 달라집니다. 따라서 보상을 계산할 수 있는지만으로 방법을 고르기는 어렵습니다. 현재 학생이 생성하는 후보 사이에 학습에 쓸 만한 보상 차이가 있는지도 확인해야 합니다.

On-policy distillation에서는 학생이 만든 경로에 교사 신호를 붙입니다. 학생이 작성한 동일한 앞부분을 교사에게도 보여주고, 그 상태에서 이어질 토큰에 대한 교사와 학생의 확률을 비교합니다. Thinking Machines가 설명한 recipe는 reverse KL을 이용합니다. GKD 연구는 학생이 생성한 시퀀스 위에서 여러 종류의 분포 차이를 학습 신호로 사용하는 더 넓은 구성을 다룹니다. Thinking Machines의 OPD 설명, GKD v3

이때 교사는 학생 답의 모든 단계를 참과 거짓으로 판정하는 완벽한 검사기가 아닙니다. 신호는 교사의 분포에서 옵니다. 교사가 해당 비율 문제를 잘못 이해한다면 학생을 엉뚱한 방향으로 이끌 수 있습니다. 또한 원하는 교사 응답을 한 번 받아 저장하는 구성과, 학생의 여러 생성 상태마다 교사 확률을 얻는 구성은 필요한 실행 자원과 인터페이스가 다릅니다.

세 방법을 선택할 때 비교할 대상은 이름의 새로움보다, 지금 확보할 수 있는 신호입니다.

현재 확보한 것 먼저 검토할 방법 첫 실험에서 확인할 것
검수한 목표 응답과 풀이 SFT 같은 스킬의 새로운 문제에서도 올바르게 출발하는가
신뢰할 수 있는 결과 판정과 탐색 예산 RLVR 학생이 생성한 후보들에 보상 차이가 생기는가
해당 문제를 잘 푸는 교사와 필요한 확률 신호 On-policy distillation 학생이 실제로 가는 경로에서 유용한 차이를 제공하는가

이 표는 순위를 매기지 않습니다. SFT로 시작한 모델에 RL을 적용할 수도 있고, 교사 답을 SFT 데이터로 쓸 수도 있습니다. 증류는 지식을 옮기는 목적이고 SFT는 학습 방식이므로 둘이 배타적인 분류도 아닙니다. 실험에서 바꾼 것이 데이터인지, 생성 주체인지, 손실 함수인지 알아야 실패했을 때 원인을 좁힐 수 있습니다.

논문 점수를 읽을 때도 같은 구분이 필요하다

Yue 등의 RLVR 연구 v5는 한 번의 성공률과 많은 시도에서의 문제 커버리지를 함께 비교합니다. Table 4의 Omni-MATH-Test 실험에서 GRPO 학습을 150스텝에서 450스텝으로 늘리자 pass@1은 25.1에서 28.3으로 올랐고, pass@256은 68.3에서 63.9로 낮아졌습니다. 해당 설정에서는 학습을 더 했을 때 두 평가가 반대 방향으로 움직였습니다. 논문 v5, §4.4·Table 4

이 결과를 모든 강화학습의 한계로 확장하면 곤란합니다. 장기간 학습과 다른 훈련 구성을 다룬 ProRL은 능력 확장의 결과를 보고합니다. 초기 모델, 데이터, 탐색과 학습 예산이 다른 연구를 같은 조건의 찬반 투표처럼 읽을 수는 없습니다. ProRL v1

서비스에 적용할 때는 ‘강화학습은 되는가’라는 질문을 더 구체적인 평가 조건으로 나눌 필요가 있습니다. 지금 필요한 업무에서 첫 응답이 개선됐는지, 추가 시도로 답할 수 있는 문제 범위가 달라졌는지, 그 답을 실제로 선택할 수 있는지를 확인합니다. 배포하려는 요청당 예산 안에서도 같은 개선이 나타나는지 함께 살펴봅니다.

좋은 답을 고르는 평가기는 무엇을 놓치는가

앞에서 최종 성공률을 계산할 때 선택기가 정답을 고르는 비율을 따로 두었습니다. 실제로 이 비율을 측정하려면 선택기가 통과시킨 답을 다시 살펴볼 기준이 필요합니다. 같은 모델이 답을 쓰고 그 답을 채점했다는 사실만으로 독립적인 확인이 끝난 것은 아닙니다.

평가기의 판단 기준을 살펴보기 위해 짧고 정확한 답과 길지만 틀린 답을 비교할 수 있습니다. 두 답의 표시 순서를 바꿨을 때 판단이 달라지는지, 근거와 무관한 설명을 덧붙였을 때 점수가 오르는지 확인합니다. 실제로 존재하지 않는 문서도 그럴듯한 출처 형식으로 인용하면 통과시키는지 함께 살펴봅니다. 이런 대조 사례는 평가기가 내용 외의 단서에 반응하는지 드러냅니다. LLM 평가자의 위치·장황함·자기 선호 편향은 MT-Bench 연구에서도 다뤄졌습니다. MT-Bench 평가 연구 v4

우리 비율 예제에서는 답 B만 확인하는 채점과 계산 근거까지 확인하는 채점이 다를 수 있습니다. ‘A는 40%, B는 20%이므로 B’라는 답은 최종 상품 이름만 보면 맞지만 설명은 모순입니다. 이 답을 정답으로 학습시키고, 선택기도 통과시키고, 최종 평가에서도 정답으로 세면 점수와 원하는 행동의 차이가 세 단계에 걸쳐 유지됩니다.

저라면 먼저 정답 기준을 문장으로 정리하겠습니다. 이 문제에서는 상품 B, A의 증가율 20%, B의 증가율 40%, 1월 값을 분모로 사용한다는 근거가 일치해야 합니다. 숫자와 형식처럼 직접 검사할 수 있는 부분을 확인하고, 자유로운 설명의 판단이 필요한 부분은 표본 검토로 보완합니다. 더 큰 모델의 평가도 이 기준에서 오류를 놓치는지 점검할 대상입니다.

평가기 버전을 바꿀 때도 같은 답 묶음을 다시 채점합니다. 점수가 오른 이유가 생성 모델의 변화인지, 검사 기준이 느슨해졌기 때문인지 나눠 보기 위해서입니다. 학습에 쓴 평가기가 볼 수 없는 최종 확인 자료도 따로 남깁니다. 평가를 반복해서 참고하는 과정 자체가 그 평가에 맞춘 선택을 만들 수 있기 때문입니다.

80점에서 82점으로 올랐을 때 바뀐 것

같은 100문제를 풀어 기존 모델은 80개, 새 모델은 82개를 맞혔다고 가정하겠습니다. 이 숫자만으로는 새로 해결한 문제와 잃어버린 문제를 알 수 없습니다.

설명용 변경 계속 맞히는 문제 새로 맞힌 문제 새로 틀린 문제 계속 틀리는 문제
변경 A 79 3 1 17
변경 B 62 20 18 0

두 변경 모두 기존 정답 수는 80, 새 정답 수는 82입니다. 그러나 B는 더 많은 문제를 새로 풀면서 이전에 맞히던 18개를 놓쳤습니다. 순증가 2개가 이 교환 관계를 숨깁니다. 새로 틀린 문제가 반드시 처리해야 하는 업무에 몰려 있다면 전체 점수가 올라도 채택하기 어렵습니다.

어떤 업무를 새로 처리하고 어떤 업무를 놓쳤는지 확인하려면, 문제 ID를 기준으로 전후 결과를 짝지어 비교해야 합니다. 새로 틀린 문제의 유형과 실패 이유를 읽고, 핵심 업무에는 전체 평균과 별도의 하한을 둡니다. 전체 점수·스킬별 성능·비용·지연이라는 조건을 평가 전에 정해두면, 결과를 본 뒤 유리한 지표만 고르는 일을 줄일 수 있습니다.

반복 생성의 변동도 남습니다. 같은 문제에서 나온 100개의 답을 서로 다른 업무 100개처럼 취급하면 평가 범위를 과장할 수 있습니다. 문제 간 차이와 같은 문제 내 생성의 변동을 구분해야 합니다. 신뢰구간이나 유의성 검정을 사용할 때도 표본 단위와 지표에 맞는 방법을 고릅니다. NLP 평가에서 실험 설정에 따라 검정 방법이 달라진다는 점은 Dror 등의 가이드가 정리합니다. 통계적 유의성 평가 가이드

여기서는 2점 차이가 유의한지에 대한 결과를 만들지 않습니다. 위 표는 결과의 구성을 설명한 가정이고 반복 측정 자료가 없기 때문입니다. 실제 비교에서는 같은 평가 문제의 짝을 유지하는 재표집이나 해당 설정에 맞는 검정을 선택하고, 차이의 크기와 불확실성을 함께 보고하겠습니다. 작은 표본에서의 미검출을 동등성의 증거로 바꾸지도 않습니다.

다음 학습 전에 만들 평가 기록

실제 모델에서는 문제별 정답 확률을 미리 알 수 없습니다. 고정한 문제에 n개의 응답을 생성하고 그중 c개가 맞았는지 기록하는 데서 시작합니다. pass@k에는 1-C(n-c,k)/C(n,k)를 사용하는 추정 방법이 있습니다. C는 조합의 수이며 k≤n인 경우에 사용합니다. n-c<k라면 정답 없이 k개를 고르는 조합은 0입니다. HumanEval 논문, RLVR 연구 v5, Appendix A.2

가령 8개 중 2개가 정답인 기록이 있다면, 4개를 골랐을 때 정답이 없는 경우는 C(6,4)=15, 전체 경우는 C(8,4)=70입니다. 추정 pass@4는 1-15/70≈78.57%입니다. 이는 관측한 2/8을 진짜 정답 확률로 간주해 1-0.75^4를 계산하는 것과 다릅니다. 표본에서 추정하는 계산과 확률을 알고 시작한 앞의 설명용 계산을 구분해야 합니다.

이 차이를 다음 실험에서 확인할 수 있도록, 전체 평균과 함께 문제별 기록을 남기겠습니다. 학습 전후에 같은 문제와 판정기를 쓰고, 샘플링 설정과 출력 한도도 고정합니다. 선택기를 비교할 때는 같은 후보 묶음을 재사용합니다. 그래야 생성기가 달라져서 생긴 차이를 선택기의 개선으로 오해하지 않습니다.

관측한 실패 다음에 바꿀 대상 변경 이유
충분히 생성해도 정답 후보가 드문 문제 학습 과제·시범·탐색 조건 선택기가 고를 재료부터 부족합니다
정답 후보가 자주 있지만 최종 답이 틀리는 문제 선택 규칙·검사기 생성 횟수를 늘리기 전에 선택 손실을 줄일 수 있습니다
특정 문서 버전에서만 틀리는 문제 검색·입력 구성·버전 처리 모델 학습만으로 잘못 들어온 근거를 고칠 수 없습니다
정답은 맞지만 비용이나 시간이 초과되는 문제 요청당 예산·경로·응답 길이 업무 성공의 제약을 충족하지 못합니다

후보가 한 번도 맞지 않았다고 정답 확률이 수학적으로 0이라고 단정하지는 않습니다. 관측한 예산에서 못 찾았다는 뜻입니다. 이 기록이 쌓이면 ‘모델이 모른다’는 뭉뚱그린 설명을 ‘이 유형에서는 8번 생성해도 정답이 드물다’처럼 시험할 수 있는 문장으로 바꿀 수 있습니다.

배포 후보를 고를 때도 정답 포함률만 높은 모델보다 주어진 예산에서 최종 응답을 더 잘 전달하는 구성을 선택하겠습니다. 반대로 학습 방향을 탐색할 때는 최종 응답에서 놓친 정답 후보까지 살펴보겠습니다. 배포 평가와 학습 진단이 서로 다른 정보를 요구하기 때문입니다.

좋아졌다는 주장을 완성하는 것은 학습법 이름이나 점수 하나가 아닙니다. 어떤 문제가 개선됐는지, 그 개선이 어떤 신호에서 나왔는지, 사용자가 받는 답까지 이어졌는지를 설명할 수 있을 때 새 모델로 바꿀 이유가 생깁니다.


다음 원고는 여기서 ‘학습 과제를 바꿔야 한다’는 진단이 나왔을 때의 작업을 다룹니다. 모델이 배울 만한 데이터를 만드는 과정에서는 문서 한 개를 출발점으로 과제를 만들고, 교사와 학생의 차이와 데이터의 범위를 함께 점검합니다.

자료와 예제

교육 자료 페이지와 본문에 연결한 논문을 바탕으로 작성했습니다. 계산과 사례의 가정은 본문에 표시했습니다. 연구 결과와 직접 실행한 검증의 범위를 구분해 읽어주세요.