Vector Space Model
VSM memandang setiap dokumen sebagai vektor dalam ruang berdimensi tinggi, di mana dimensi tersebut merepresentasikan istilah (kata) unik dalam koleksi dokumen. Bobot tiap istilah biasanya ditentukan oleh tf-idf (Term Frequency Inverse Document Frequency). Kemiripan antar vektor dihitung dengan cosine similarity, nilai antara 0 (tidak mirip) hingga 1 (identik). Pendekatan ini bersifat matematis, mengabaikan urutan kata, namun sangat efektif untuk teks berbahasa Indonesia yang banyak mengandung sinonim dan variasi tata bahasa.
