Skip to content

Commit ca669ef

Browse files
committed
Update p0_theory_handson_intro.ipynb
1 parent 6a314f4 commit ca669ef

1 file changed

Lines changed: 11 additions & 24 deletions

File tree

p0_theory_handson_intro.ipynb

Lines changed: 11 additions & 24 deletions
Original file line numberDiff line numberDiff line change
@@ -181,7 +181,15 @@
181181
"\n",
182182
"이제 하나의 작은 예제로 머신러닝의 핵심 개념을 살펴보자.\n",
183183
"\n",
184-
"OECD 회원국과 일부 비회원국의 **1인당 국내총생산**(GDP per capita)과 **삶의 만족도**(Life satisfaction)를 이용한다.\n",
184+
"2020년 기준 37개 OECD 회원국과 3개의 비회원국의 **1인당 국내총생산**(GDP per capita)과 **삶의 만족도**(Life satisfaction)를 이용한다.\n",
185+
"\n",
186+
"| 지역 | OECD 회원국 | 기타 |\n",
187+
"|--------------|----------------------------------------|--------------------------|\n",
188+
"| 유럽 | 오스트리아, 벨기에, 체코, 덴마크, 에스토니아, 핀란드, 프랑스, 독일, 그리스, 헝가리, 아이슬란드, 아일랜드, 이탈리아, 라트비아, 리투아니아, 룩셈부르크, 네덜란드, 노르웨이, 폴란드, 포르투갈, 슬로바키아, 슬로베니아, 스페인, 스웨덴, 스위스, 튀르키예, 영국 | 브라질 |\n",
189+
"| 북미 | 캐나다, 미국, 멕시코 | 러시아 |\n",
190+
"| 아시아-태평양 | 일본, 한국, 호주, 뉴질랜드 | 남아프리카공화국 |\n",
191+
"| 중남미 | 칠레, 콜롬비아 (2020년 가입) | |\n",
192+
"| 중동 | 이스라엘 | |\n",
185193
"\n",
186194
"질문은 단순하다.\n",
187195
"\n",
@@ -197,7 +205,7 @@
197205
"\n",
198206
"타깃이 수치이므로 이 문제는 **회귀 문제**다.\n",
199207
"\n",
200-
"아래 그림은 일부 국가를 제외한 31개 국가의 관계를 보여준다.\n",
208+
"아래 그림은 1인당 GDP가 23,500 달러 이하이거나 62,500 달러 이상인 9개 국가를 제외한 31개 국가의 관계를 보여준다.\n",
201209
"\n",
202210
"<div align=\"center\">\n",
203211
" <img src=\"https://github.com/codingalzi/code-workout-ml/blob/master/images/ch01/homl01-17-b.png?raw=true\" width=\"450\">\n",
@@ -358,7 +366,7 @@
358366
"source": [
359367
"## 훈련 데이터가 달라지면 모델도 달라질까?\n",
360368
"\n",
361-
"앞의 모델은 일부 국가를 제외한 31개 국가로 학습했다.\n",
369+
"앞의 모델은 저소득과 고소득 9개 국가를 제외한 31개 국가로 학습했다.\n",
362370
"\n",
363371
"이번에는 제외했던 저소득·고소득 국가들을 다시 포함해 전체 40개 국가로 선형 회귀 모델을 학습해 보자.\n",
364372
"\n",
@@ -454,27 +462,6 @@
454462
"> **훈련 데이터를 얼마나 잘 맞혔는가보다 새로운 데이터에서도 잘 작동하는가가 중요하다.**"
455463
]
456464
},
457-
{
458-
"cell_type": "markdown",
459-
"id": "bc5eef80",
460-
"metadata": {},
461-
"source": [
462-
"## 훈련 데이터와 테스트 데이터\n",
463-
"\n",
464-
"일반화 성능을 확인하려면 모델이 학습할 때 사용하지 않은 데이터가 필요하다.\n",
465-
"\n",
466-
"그래서 데이터를 보통 다음처럼 구분한다.\n",
467-
"\n",
468-
"- **훈련 데이터**(training set): 모델을 학습하는 데 사용\n",
469-
"- **테스트 데이터**(test set): 학습이 끝난 모델의 성능을 확인하는 데 사용\n",
470-
"\n",
471-
"테스트 데이터가 필요한 이유는 단순하다.\n",
472-
"\n",
473-
"> **이미 본 데이터로 평가하면 새로운 데이터에서의 실력을 알기 어렵기 때문이다.**\n",
474-
"\n",
475-
"실제 프로젝트에서는 모델 선택을 위해 검증 데이터(validation set)나 교차검증(cross-validation)도 사용한다. 이 내용은 다음 장에서 자세히 다룬다."
476-
]
477-
},
478465
{
479466
"cell_type": "markdown",
480467
"id": "e43d3859",

0 commit comments

Comments
 (0)