묻고 답해요
143만명의 커뮤니티!! 함께 토론해봐요.
인프런 TOP Writers
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형1, 3 제출방식
선생님 실제 시험환경에서 제출방식에 대한 질문이 있습니다.7회차부터 답안 제출 방식이 바뀌었다고 들었습니다. 작업형1, 3유형에서 (풀이용) 코드는 따로 제출하지 않고 풀이만 해서 저장하고(답안제출)에서 답만 제출하면 되는건가요?? 그렇다면 실제로 (풀이용) 탭에서 작성한 코드에 대해서는 따로 채점을 하지 않는다는 걸까요? 실제 체험환경과 강의에 올려주신 9회 응시가이드 화면이 달라서 문의드립니다. <응시가이드> <체험환경>
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
인코딩 및 ensemble 관련 문의사항입니다.
LabelEncoder를 해도 되고 원핫 인코딩을 해도 아무 상관이 없나요예를 들면 기출 6 작업형 2에 LabelEncoder를 쓰니 성능이 잘 나오는데 성능이 잘 나오는 것으로 쓰면 되는 지요그리고 작업형 어떤 ensemble을 쓰던 적당한 값이 나오면 40점을 받을 수 있는 것인가요?metrics으로 자체 확인을 하지 않고 내더라도 낸 결과가 적당한 결과이면 점수를 받는 것인가요?순전히 시험 점수 측면 획득 측면에서 여쭤 봅니다. 시험이 아니라면 이것 저것 해보겠지만 시험에서는 실수하는 것보다 단순하게 하는 것이 좋을 것 같습니다. 보통 RandomForest로 해도 적당한 결과가 나오는데 과거 기출 기준에서는 validation 예측/비교 없이(생략하고) 1~2개의 기법으로 test값만 예측해도 되는 것인지요
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
4회 기출유형 작업형 1
2번 문제를 len이 아니라 result_count = sum(cond1 & cond2 & cond3) print(result_count) 이런 방법으로 풀어도 될까요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
기출2회 문제3
mean = df['age'].mean() std = df['age'].std()*1.5 lower = mean-std upper = mean+std cond1 = df['age']<lower cond2 = df['age']>upper print(df[cond1|cond2]['age'].sum())이렇게 구했는데, 값이 368.5로 나옵니다. 왜일까요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
캐글 로지스틱 회귀 문제 질문입니다.
t3-logit-py # 문제 1-2: 독립변수 income만 사용해 학습한 모델에서 test 데이터의 purchase를 예측하고, 정확도 계산 predictions_income = result_income.predict(test) predicted_classes_income = (predictions_income > 0.5).astype(int) 이 문제에서 왜 prediction_income > 0.5를 하는건가요 ?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
샤피로-윌크 검정과 관련된 질문
앞의 강의 단일 표본 검정에서의 샤피로 윌크 검정처럼 대립가설을 '정규성을 따른다' 라고 세우려면 어떻게 코드를 짜야할까요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
인코딩 시 unique값 순서
안녕하세요! 회귀 코드를 보던 중 궁금한 점이 생겨 질문 남깁니다. 강의에서는 원핫인코딩 전에 describe(include= 'object')를 통해 train, test의 범주형 데이터 unique 수가 일치하는 것만 확인하고, train/test 병합 작업 없이 원핫 인코딩을 수행했습니다. 제가 실습하는 중에, train/test의 각 unique값을 출력했는데 캡쳐본과 같이 smoker 에서 yes,no의 순서가 바뀌어서 나왔습니다. 이 경우에는 unique값의 종류는 같지만, 병합 없이 각자 인코딩을 할 경우 train 데이터 -> yes:0, no:1test 데이터 -> no:1, yes:1와 같이 인코딩되지 않을까 생각이 들었습니다. unique 종류만 일치하면, 순서가 다르더라도 따로 병합하여 인코딩 하지 않아도 되는 것일까요?
-
미해결[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
Encoders require their input argument must be uniformly strings or numbers. Got ['int', 'str'] 라는 오류가 떴습니다.
보니깐 int와 str이 혼합되어서 뜬것 같은데..cols = X_train.select_dtypes(include = 'object').columns print(list) from sklearn.preprocessing import LabelEncoder cols = X_train.select_dtypes(include = 'object').columns le = LabelEncoder() for col in cols : le = LabelEncoder() X_train[col] = le.fit_transform(X_train[col]) X_test[col] = le.transform(X_test[col]) 그래서 이렇게 cols라는 코드를 사전에 지정해줬는데... 왜 뜰까요?처음부터 숫자와 str 데이터를 분리해서 인코딩 했어야 할까요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형 2에서 예시가 1, 0으로 되어있어도 상관없이 소수점으로 제출해도 되나요?
작업형 2에서 예시가 1, 0으로 되어있어도 상관없이 소수점으로 제출해도 되나요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
캐글에서는 아직 rmse를 쓸 수 없는건가요?
mae 평가 방법은 정상 작동하는 걸 확인했는데,rmse를 제가 잘못 작성한건가요?아니면 캐글에서는 아직 안되는 걸까요?만약 작성이 옳은거면 저대로 시험에서도 사용할 예정이고그렇지 않다면, 함수식을 그냥 외워가야 하나 싶어서요.
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
2회 기출유형 작업형 2
17:13 부분 궁금해서 물어봅니다. 이미 pd.concat으로 데이터를 합쳤는데... 학습과 검증데이터를 나눌때 X_train, y_train 나눠서 작업해야 하나요? X_train['Reached.on.Time_Y.N']으로 하면 안되나요??
-
미해결파이썬 증권 데이터 수집과 분석으로 신호와 소음 찾기
데이터프레임 칼럼명 문의 드립니다.
데이터 프레임 칼럼을 뽑았더니 이렇게 나와요 !! 칼럼에 대한 한글 정보도 알고 싶은데 ㅜㅜ 깃에서 보이는 칼럼명이랑 좀 많이 달라서요!!! 초보다보니 변경된 부분이 좀 있어서 헷갈리는게 많은 것 같아요 ㅜㅜ
-
미해결[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
len함수와 sum 함수의 차이가 궁금합니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요!질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요먼저 유사한 질문이 있었는지 검색해보세요 캐글 필사 전략 강의를 수강하며 캐글에서 타이타닉 문제를 풀어보고 있는 중인데 궁금한 점이 있습니다. 살아남은 여성의 확률을 구할 때women = train_data.loc[train_data.Sex == 'female']["Survived"]rate_women = sum(women)/len(women)print("% of women who survived:", rate_women) 이 코드를 작성하는데여기서 sum(women)의 값과 len(women)의 값이 왜 다른지 궁금합니다. sum의 경우에도 살아남은 여성의 수를 계산하고 len의 경우에도 리스트의 개수를 리턴하기 때문에 동일한 값이라고 생각했습니다.len함수와 sum 함수의 차이가 궁금합니다.
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
회귀문제에서 LabelEncoder 사용가능 여부
안녕하세요 선생님, 회귀문제(ex. RandomForestRegressor)를 풀 때범주형 변수에 대해 LabelEncoder를 사용해도 되나요?아니면 pd.get_dummies만 가능한가요?
-
미해결[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
다중회귀와 다중선형회귀 공식
다중회귀와 다중선형회귀 공식이 틀린거죠? 다중회귀import statsmodels.stats.api as sm 다중선형회귀from statsmodels.formula. api import ols
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
계수
3유형에서 가장 큰 회귀계수를 구하라 하면 const도 포함인가요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
train test 컬럼에 대한 질문입니다.
train과 test의 컬럼이 서로 다른경우가 시험에서 발생하는 경우가 잇나요? 이럴때는 train과 test의 교집합에 없는 컬럼들은제 생각으론 삭제하는것이 어떤 처리방법보다 좋은것같은데요(train에만 잇다면 삭제하는게 test에 좋을것이고test에만잇다면 train이 모델 훈련해도 해당 test컬럼과는 관련이없고) 제 생각이 맞나요? 또한 하나의 공통 컬럼에서서로 교차하지않는 서로다른 데이터가 존재한다면라벨이나 원핫인코딩을 진행할때 둘다 반드시합쳐서 인코딩을 진행하고 분리해야하나요?
-
미해결파이썬 증권 데이터 수집과 분석으로 신호와 소음 찾기
금융데이터 수집의 모든것
안녕하세요, https://github.com/FinanceData/FinanceDataReader?tab=readme-ov-file 수업듣고 있는데, tutorial 부분에 6개 종류가 더있는 것 같은데 실제 깃에는 2개밖에 없어서요 혹시 2024년 기준으로 업데이트 된 걸까요?? - 학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! - 먼저 유사한 질문이 있었는지 검색해보세요. - 서로 예의를 지키며 존중하는 문화를 만들어가요. - 잠깐! 인프런 서비스 운영 관련 문의는 1:1 문의하기를 이용해주세요.
-
미해결[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
baseline , 라벨인코딩, 원핫인코딩 평가 결과값 다르게
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요!질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요먼저 유사한 질문이 있었는지 검색해보세요강의 들으면서 코드 똑같이 타이핑해서 결과값 확인 하는데요 머신러닝 돌리고 나서 정확도, 정밀도 F1 score, roc-auc 같은 결과값이강의랑 조금 다르게 나오는데(예를 들어 강의에서는 baseline 이 라벨인코딩보다 정확도가 더 높은데 제가 코드 돌렸을 때는 라벨인코딩이 조금 높게 나온다던지,,) 똑같이 코드를 작성해도 학습했을 때 다르게 나올 수도 있는거죠..? (여러번돌린값X)random_state 나 test_size 도 강의랑 똑같이 설정했는데도요!
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
submit 오류
submit 생성 과정에서 어떤 오류인지 모르겠습니다.