Con el rápido desarrollo de la tecnología de Internet, se puede obtener una gran cantidad de datos de texto de Internet. La tecnología de clasificación de textos (TC) desempeña un papel muy importante en el procesamiento de datos de texto masivos, pero la precisión de la clasificación se ve directamente afectada por el rendimiento de la ponderación de términos en TC. Debido al diseño original de la recuperación de información (RI), la frecuencia de términos-frecuencia inversa de documentos (TF-IDF) no es lo suficientemente eficaz para la CT, especialmente para procesar datos de texto con distribuciones desequilibradas en informes de medios de Internet. Por lo tanto, se propone la varianza entre el valor DF de un término concreto y la media de todos los DF, es decir, la varianza de frecuencia de documento (ADF), para mejorar la capacidad de procesar datos de texto con una distribución desequilibrada. A continuación, el TF-IDF normal se modifica mediante la ADF propuesta para procesar colecciones de texto desequilibradas de cuatro formas diferentes, a saber, TF-IADF, TF-IADF y TF-IADF. Como resultado, se puede establecer un modelo eficaz para la tarea de CT de los informes de los medios de comunicación en Internet. Se han realizado una serie de simulaciones para evaluar el rendimiento de los métodos propuestos. Los resultados de las simulaciones confirman la eficacia y viabilidad de los métodos propuestos en comparación con TF-IDF en algoritmos de clasificación de última generación.
Esta es una versión de prueba de citación de documentos de la Biblioteca Virtual Pro. Puede contener errores. Lo invitamos a consultar los manuales de citación de las respectivas fuentes.
Artículos:
¿Cómo se sobreestima el margen de beneficio bruto en China?
Artículos:
Algunos resultados de existencia para un sistema de ecuaciones diferenciales fraccionarias no lineales.
Artículos:
Modelado matemático de la dinámica de transmisión de la pleuroneumonía contagiosa bovina con vacunación y tratamiento con antibióticos.
Artículos:
Existencia de soluciones casi periódicas para sistemas cooperativos de Lotka-Volterra con retardo temporal.
Artículos:
Control Difuso Adaptativo de Estructura Variable de Manipuladores Robóticos de Segundo Orden con Zonas Muertas
Artículos:
Comportamiento del aguacate Hass liofilizado durante la operación de rehidratación
Artículos:
Caracterización estructural de la materia orgánica de tres suelos provenientes del municipio de Aquitania-Boyacá, Colombia
Informes y Reportes:
Técnicas de recuperación de suelos contaminados
Artículos:
Una revisión de la etiopatogenia y características clínicas e histopatológicas del melanoma mucoso oral.