데이터 공부

Vocabulary 크기 변경해보기

데이터분석가 소히의 개발일지 2021. 7. 6. 05:12

DTM을 만들 때, CountVectorizer를 사용하여 빈도수가 높은 상위 n개의 단어로 줄일 수 있다. 

이는 객체를 만들 때, max_features라는 인자를 주어서 가능하다. 

 

입력으로 들어오는 x_train 데이터의 단어의 빈도수를 전부 카운트를 해서, n개 까지만, dtm을 만든다. 

 

dtmvector = CountVectorizer(max_features = n)
x_train_dtm = dtmvector.fit_transform(x_train)

 

행과 열을 만들고, 

print(x_train_dtm.shape)를 하면, 행과 열의 크기가 출력이된다!

 

결론 = 단어를 몇개를 쓰는지에 따라 머신러닝 모델의 성능이 달라진다!