|
181 | 181 | "\n", |
182 | 182 | "이제 하나의 작은 예제로 머신러닝의 핵심 개념을 살펴보자.\n", |
183 | 183 | "\n", |
184 | | - "OECD 회원국과 일부 비회원국의 **1인당 국내총생산**(GDP per capita)과 **삶의 만족도**(Life satisfaction)를 이용한다.\n", |
| 184 | + "2020년 기준 37개 OECD 회원국과 3개의 비회원국의 **1인당 국내총생산**(GDP per capita)과 **삶의 만족도**(Life satisfaction)를 이용한다.\n", |
| 185 | + "\n", |
| 186 | + "| 지역 | OECD 회원국 | 기타 |\n", |
| 187 | + "|--------------|----------------------------------------|--------------------------|\n", |
| 188 | + "| 유럽 | 오스트리아, 벨기에, 체코, 덴마크, 에스토니아, 핀란드, 프랑스, 독일, 그리스, 헝가리, 아이슬란드, 아일랜드, 이탈리아, 라트비아, 리투아니아, 룩셈부르크, 네덜란드, 노르웨이, 폴란드, 포르투갈, 슬로바키아, 슬로베니아, 스페인, 스웨덴, 스위스, 튀르키예, 영국 | 브라질 |\n", |
| 189 | + "| 북미 | 캐나다, 미국, 멕시코 | 러시아 |\n", |
| 190 | + "| 아시아-태평양 | 일본, 한국, 호주, 뉴질랜드 | 남아프리카공화국 |\n", |
| 191 | + "| 중남미 | 칠레, 콜롬비아 (2020년 가입) | |\n", |
| 192 | + "| 중동 | 이스라엘 | |\n", |
185 | 193 | "\n", |
186 | 194 | "질문은 단순하다.\n", |
187 | 195 | "\n", |
|
197 | 205 | "\n", |
198 | 206 | "타깃이 수치이므로 이 문제는 **회귀 문제**다.\n", |
199 | 207 | "\n", |
200 | | - "아래 그림은 일부 국가를 제외한 31개 국가의 관계를 보여준다.\n", |
| 208 | + "아래 그림은 1인당 GDP가 23,500 달러 이하이거나 62,500 달러 이상인 9개 국가를 제외한 31개 국가의 관계를 보여준다.\n", |
201 | 209 | "\n", |
202 | 210 | "<div align=\"center\">\n", |
203 | 211 | " <img src=\"https://github.com/codingalzi/code-workout-ml/blob/master/images/ch01/homl01-17-b.png?raw=true\" width=\"450\">\n", |
|
358 | 366 | "source": [ |
359 | 367 | "## 훈련 데이터가 달라지면 모델도 달라질까?\n", |
360 | 368 | "\n", |
361 | | - "앞의 모델은 일부 국가를 제외한 31개 국가로 학습했다.\n", |
| 369 | + "앞의 모델은 저소득과 고소득 9개 국가를 제외한 31개 국가로 학습했다.\n", |
362 | 370 | "\n", |
363 | 371 | "이번에는 제외했던 저소득·고소득 국가들을 다시 포함해 전체 40개 국가로 선형 회귀 모델을 학습해 보자.\n", |
364 | 372 | "\n", |
|
454 | 462 | "> **훈련 데이터를 얼마나 잘 맞혔는가보다 새로운 데이터에서도 잘 작동하는가가 중요하다.**" |
455 | 463 | ] |
456 | 464 | }, |
457 | | - { |
458 | | - "cell_type": "markdown", |
459 | | - "id": "bc5eef80", |
460 | | - "metadata": {}, |
461 | | - "source": [ |
462 | | - "## 훈련 데이터와 테스트 데이터\n", |
463 | | - "\n", |
464 | | - "일반화 성능을 확인하려면 모델이 학습할 때 사용하지 않은 데이터가 필요하다.\n", |
465 | | - "\n", |
466 | | - "그래서 데이터를 보통 다음처럼 구분한다.\n", |
467 | | - "\n", |
468 | | - "- **훈련 데이터**(training set): 모델을 학습하는 데 사용\n", |
469 | | - "- **테스트 데이터**(test set): 학습이 끝난 모델의 성능을 확인하는 데 사용\n", |
470 | | - "\n", |
471 | | - "테스트 데이터가 필요한 이유는 단순하다.\n", |
472 | | - "\n", |
473 | | - "> **이미 본 데이터로 평가하면 새로운 데이터에서의 실력을 알기 어렵기 때문이다.**\n", |
474 | | - "\n", |
475 | | - "실제 프로젝트에서는 모델 선택을 위해 검증 데이터(validation set)나 교차검증(cross-validation)도 사용한다. 이 내용은 다음 장에서 자세히 다룬다." |
476 | | - ] |
477 | | - }, |
478 | 465 | { |
479 | 466 | "cell_type": "markdown", |
480 | 467 | "id": "e43d3859", |
|
0 commit comments