
DTM을 만들 때, CountVectorizer를 사용하여 빈도수가 높은 상위 n개의 단어로 줄일 수 있다.
이는 객체를 만들 때, max_features라는 인자를 주어서 가능하다.
입력으로 들어오는 x_train 데이터의 단어의 빈도수를 전부 카운트를 해서, n개 까지만, dtm을 만든다.
dtmvector = CountVectorizer(max_features = n)
x_train_dtm = dtmvector.fit_transform(x_train)
행과 열을 만들고,
print(x_train_dtm.shape)를 하면, 행과 열의 크기가 출력이된다!
결론 = 단어를 몇개를 쓰는지에 따라 머신러닝 모델의 성능이 달라진다!
'데이터 공부' 카테고리의 다른 글
| 데이터 정규화하기 (0) | 2021.07.08 |
|---|---|
| 신용카드 사기탐지 - 데이터 파악하기 (0) | 2021.07.08 |
| 머신러닝의 평가방법 (0) | 2021.07.07 |
| 다양한 머신러닝 알고리즘 사용해보기(1~3) (0) | 2021.07.06 |
| 부동산 가격 예측 프로젝트 (0) | 2021.06.24 |