TF-IDF

¿Qué palabras son DISTINTIVAS de cada diario?

Noticias de los últimos:
La Capital

Palabras que distinguen a este medio de los otros:

elo 0.001
efe 0.000
morales 0.000
senasa 0.000
proteinas 0.000
economia 0.000
vicuna 0.000
petro 0.000
chavez 0.000
moreira 0.000
lunfardo 0.000
record 0.000
alimentario 0.000
elbulli 0.000
palabras 0.000
0223

Palabras que distinguen a este medio de los otros:

pozo 0.001
radicar 0.000
sujetos 0.000
dijeron 0.000
calu 0.000
averiguacion 0.000
instantes 0.000
fava 0.000
autismo 0.000
atletismo 0.000
vinos 0.000
quini 0.000
aabe 0.000
cercanias 0.000
antonella 0.000
El Marplatense

Palabras que distinguen a este medio de los otros:

soriano 0.001
gatos 0.000
ceramica 0.000
tapia 0.000
messina 0.000
medicamentos 0.000
pelicula 0.000
disney 0.000
pintos 0.000
transmision 0.000
pastas 0.000
musical 0.000
netflix 0.000
montenegro 0.000
teatro 0.000
Cómo leer este análisis

Palabras DISTINTIVAS de cada fuente, no solo las frecuentes.

⚠️ Es bag-of-words: ignora el orden y la sintaxis. Necesita un corpus razonable para que el IDF tenga sentido (no rinde con 5 documentos).
¿Qué es TF-IDF? — ver más
En simple

Imaginá que tenés que diferenciar a tres diarios. Decir que todos usan «gobierno», «ayer» o «dijo» no sirve: eso lo usan todos. Lo que distingue a cada uno son las palabras que casi solo él usa. TF-IDF encuentra justo esas.

Cómo funciona

Combina dos medidas: cuántas veces aparece una palabra en un texto (TF, la frecuencia) y qué tan rara es en el resto del corpus (IDF). Una palabra frecuente en un diario pero ausente en los demás se dispara; una que usan todos, como «gobierno», se apaga.

En profundidad

Formalmente: TF-IDF = frecuencia del término × log(total de documentos ÷ documentos que contienen el término). Ese segundo factor (IDF) es el que castiga lo común y premia lo específico. El resultado es un ranking de palabras ordenado por cuánto caracterizan a cada fuente.

¿Qué palabras ignoramos? Las stopwords (191)

La lista de palabras que se excluyen antes de contar frecuencias: artículos, preposiciones, conjunciones y verbos auxiliares. Las palabras funcionales son las más frecuentes de cualquier idioma (ley de Zipf) pero no cargan tema. Filtrarlas es el primer paso estándar del preprocesamiento en minería de texto.

⚠️ La lista es una decisión editorial: agregar o quitar palabras cambia los resultados. Por eso la publicamos completa en cada herramienta que la usa. Sin filtrar, «de», «la» y «que» encabezan cualquier ranking y tapan los términos con contenido.

acerca · ademas · ahi · ahora · aires · al · algo · alguna · alguno · alli · ambos · ano · anos · ante · antes · aquel · aquella · aquellas · aquello · aquellos · aqui · asi · aunque · ayer · bajo · bien · buenos · cada · caso · como · con · contra · cual · cuales · cualquier · cualquiera · cuando · dar · de · debe · deber · decir · del · dentro · desde · despues · dia · dias · dijo · dio · donde · dos · durante · e · el · ella · ellas · ellos · en · entre · era · es · esa · esas · ese · eso · esos · esta · estan · estar · estas · este · esto · estos · forma · fue · fuera · fueron · ha · haber · habia · hace · hacer · hacia · han · hasta · hay · hizo · hoy · ir · junto · la · las · le · les · lo · los · luego · manana · manera · mar · mas · me · mediante · mi · mientras · mis · misma · mismo · mucho · muy · nada · ni · ningun · ninguna · ninguno · no · nos · nosotros · nunca · o · otra · otras · otro · otros · para · parte · pero · plata · poco · poder · podria · poner · por · porque · puede · pueden · pues · que · querer · quien · quienes · respecto · saber · se · segun · según · ser · sera · seria · si · sido · siempre · siendo · sin · sin embargo · sino · sobre · solo · son · su · sus · tambien · tan · tanto · te · tener · tiempo · tiene · tienen · toda · todas · todo · todos · tras · traves · tres · tu · tuvo · u · un · una · unas · uno · unos · varios · ver · vez · y · ya · yo