해결된 질문
작성
·
37
0
# RandomForestRegressor
from sklearn.ensemble import RandomForestRegressor
model = RandomForestRegressor()
model.fit(X_tr, y_tr)
pred = model.predict(X_val)
rmse(y_val, pred)
머신러닝 회귀 모델에서
스케일링 해둔걸 주석처리하고 이전 셀 실행 후
위 코드를 실행해서 베이스라인 값을 체크하려는데,
강의와 다른 값이 나와서 한번 더 실행했더니 값이 또 바뀌는데 원인이 뭘까요?
이후에도 계속 실행할수록 값이 매번 바뀝니다!
답변 2
0
지극히 정상입니다.
그래서 RandomForestRegressor(random_state=0)
과 같이 작성을 추천합니다.
계속 변경되면 전처리로 변경된 것인지 랜덤인지 알 수 없습니다.
랜덤적인 요소를 random_state
를 통해 고정할 수 있어요
정수 아무거나 사용하면 됩니다.
0
안녕하세요, 인프런 AI 인턴입니다. 오벽님 질문에 대해 답변드리겠습니다.
작성하신 코드에서 RandomForestRegressor 모듈을 사용할 때 모델의 결과가 매번 다르게 발생하는 이유는 바로 무작위성(randomness) 때문일 가능성이 큽니다. 랜덤 포레스트와 같은 알고리즘은 기본적으로 여러 개의 의사결정 트리를 생성하고, 이를 통해 예측을 수행합니다. 이 과정에서 일부 알고리즘은 데이터의 서브샘플링이나 피처의 무작위 선택 등 무작위 요소를 포함해서 다양한 결과가 나올 수 있습니다.
이를 해결하는 방법으로는 모델을 초기화할 때 random_state 매개변수를 설정하여 무작위성을 고정하는 것이 있습니다. 예를 들어:
from sklearn.ensemble import RandomForestRegressor
model = RandomForestRegressor(random_state=42)
model.fit(X_tr, y_tr)
pred = model.predict(X_val)
print(rmse(y_val, pred))
이렇게 random_state를 설정하면 실행할 때마다 동일한 결과값을 얻을 수 있습니다. random_state는 무작위성에서 일정한 패턴을 통해 실행 결과를 재현 가능한(reproducible) 형태로 바꿔 줍니다.
다음 URL에서 유사한 질문을 참고하실 수 있습니다:
- 회귀 실습 중 rmse 결과값 질문
저는 질문자님의 이해를 돕고자 지식공유자님의 기존 답변을 참고하여 유사한 답변 링크를 추천해드리고 있습니다.
현재 베타 기능으로 답변이 만족스럽지 않을 수 있는 점 양해 부탁드립니다. 🙏
추가적으로 궁금한 점이 있으시면, 이어서 질문해 주세요. 곧 지식공유자께서 답변해 주실 것입니다.