Con el rápido desarrollo de la tecnología de Internet, se puede obtener una gran cantidad de datos de texto de Internet. La tecnología de clasificación de textos (TC) desempeña un papel muy importante en el procesamiento de datos de texto masivos, pero la precisión de la clasificación se ve directamente afectada por el rendimiento de la ponderación de términos en TC. Debido al diseño original de la recuperación de información (RI), la frecuencia de términos-frecuencia inversa de documentos (TF-IDF) no es lo suficientemente eficaz para la CT, especialmente para procesar datos de texto con distribuciones desequilibradas en informes de medios de Internet. Por lo tanto, se propone la varianza entre el valor DF de un término concreto y la media de todos los DF, es decir, la varianza de frecuencia de documento (ADF), para mejorar la capacidad de procesar datos de texto con una distribución desequilibrada. A continuación, el TF-IDF normal se modifica mediante la ADF propuesta para procesar colecciones de texto desequilibradas de cuatro formas diferentes, a saber, TF-IADF, TF-IADF y TF-IADF. Como resultado, se puede establecer un modelo eficaz para la tarea de CT de los informes de los medios de comunicación en Internet. Se han realizado una serie de simulaciones para evaluar el rendimiento de los métodos propuestos. Los resultados de las simulaciones confirman la eficacia y viabilidad de los métodos propuestos en comparación con TF-IDF en algoritmos de clasificación de última generación.
Esta es una versión de prueba de citación de documentos de la Biblioteca Virtual Pro. Puede contener errores. Lo invitamos a consultar los manuales de citación de las respectivas fuentes.
Artículo:
Diagnóstico de fallos en motores aeronáuticos mediante bases discriminantes locales mejoradas y máquinas de vectores soporte
Artículo:
El Método de Espacio de Producto Interno Parcial: Una Visión General Rápida
Artículo:
Estudio de los protocolos de carga cuasiestática teniendo en cuenta las características de acción de los movimientos del suelo de larga duración
Artículo:
Sobre la Reducibilidad de Sistemas Hamiltonianos Lineales Cuasiperiódicos y sus Aplicaciones en la Ecuación de Schrödinger
Artículo:
Desenmascaramiento de imágenes mediante difusión híbrida no lineal