인프런 커뮤니티 질문&답변

뚜디니님의 프로필 이미지

작성한 질문수

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

모델링 및 평가(분류)

모델링 및 평가(분류) 강의에서

해결된 질문

24.05.31 13:17 작성

·

107

0

  • 학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요!

  • 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요

  • 먼저 유사한 질문이 있었는지 검색해보세요

아래 보시면 학습용 데이터와 검증용 데이터로 구분하는 것은 이해가 되는데, y부터 마지막까지의 식이 왜 나오는지 이해가 안됩니다...다시 설명 부탁드립니다.

# 학습용 데이터와 검증용 데이터로 구분
from sklearn.model_selection import train_test_split
y = (y_train['income'] == '>50K').astype(int)
X_tr, X_val, y_tr, y_val = train_test_split(X_train, y, test_size=0.1, random_state=2000)

답변 1

1

퇴근후딴짓님의 프로필 이미지
퇴근후딴짓
지식공유자

2024. 05. 31. 21:15

문자를 0과 1로 변환하기 위해 사용했어요!

y는

'income'이 '>50K'인 경우 1,

그렇지 않은 경우 0인 이진(target) 변수로 변환하기 위해 작성한 코드에요

 

그럼 무조건 문자일때 변경해야 하느냐?

아니요!

모델 학습까지는 변환하지 않더라도 정상 작동 됩니다.

선택의 문제인데

일부 평가지표에서 추가적인 설정이 필요할 때가 있어 0과 1로 변환했습니다. (타겟이 문자일 때 평가지표 강의 영상 확인 요청)

 

어떤 의미냐?

1 조건: y_train['income'] == '>50K' -> True 또는 False가 나옴

2 자료형 변경: .astype(int) -> 논리 연산의 결과(True/False)를 정수형(int)으로 변환 True 1, False0

 

기출에서 사용된적 있냐?

없습니다. 어렵다면 일단은 패스하고 넘어가주세요!

난이도가 올라갔을 때를 가정했습니다.