La inversión articulatoria ofrece nuevas perspectivas y aplicaciones interesantes en el campo de la voz; sin embargo, es aún un problema por resolver. El presente trabajo ofrece un método para la estimación de la distribución de la información articulatoria contenida en la acústica de consonantes explosivas, cuya parametrización se realiza mediante la transformada wavelet packet. El trabajo se centra principalmente en estimar la información acústica relevante, en términos de asociación estadística, para la inferencia de la posición de los órganos articuladores críticos involucrados en la producción de consonantes explosivas. Se usa el coeficiente de Kendall a modo de medida de relevancia. Los mapas de relevancia de tiempo-frecuencia se calculan para la base de datos MOCHA–TIMIT; de la cual, las zonas correspondientes a las consonantes explosivas son analizados. El método propuesto entrega un conjunto de componentes de tiempo-frecuencia intimamente relacionados al fenómeno articulatorio, lo cual ofrece un entendimiento más profundo de la relación existente entre los fenómenos articulatorio y acústico. Los mapas de relevancia se prueban en un sistema de inversión articulatoria basado en modelos de mezclas gausianas, donde se muestra que mejoran el desempeño de los mencionados sistemas aplicados sobre consonantes explosivas. El método se puede extender a otras categorías articulatorias, p.e. fricativas, con el fin de adaptar el presente método a sistemas de inversión articulatoria sobre voz continua.
1 INTRODUCCIÓN
La inferencia de la posición de los articuladores, a partir de la información acústica contenida en la señal del habla, ofrece nuevas perspectivas e interesantes aplicaciones en el campo del procesamiento del habla. Un sistema adecuado para recuperar las configuraciones articulatorias, a partir de la señal acústica del habla, podría utilizarse en varias aplicaciones: ayudas visuales en tareas de entrenamiento articulatorio para personas con problemas de audición o de habla; programas de aprendizaje de segundas lenguas guiados por ordenador para mostrar la pronunciación correcta e incorrecta [1]; codificación de baja tasa de bits, ya que los articuladores se mueven de forma relativamente lenta [2]; y representación complementaria en los sistemas de reconocimiento del habla para mejorar su rendimiento, ya que los parámetros articulatorios representan mejor los fenómenos relacionados con la coarticulación [3].
Los gestos del habla son movimientos planificados en una secuencia coordinada, cuyas acciones son relativamente lentas y se solapan.
Esta es una versión de prueba de citación de documentos de la Biblioteca Virtual Pro. Puede contener errores. Lo invitamos a consultar los manuales de citación de las respectivas fuentes.
Artículo:
En la Evaluación de Dieléctricos de Puerta para MOSFETs de Potencia Basados en 4H-SiC
Artículo:
Generación de doble banda en antenas de Microcinta rectangulares utilizando ranuras separadas en secuencia de cantor
Artículo:
Análisis del comportamiento de líneas de transmisión frente al rayo mediante el método de Monte Carlo y cálculo paralelo
Artículo:
Mejora del aislamiento entre antenas repetidoras de interior con resistencia de chip FSS incorporada
Artículo:
Detección de pequeños desplazamientos de señales biológicas mediante el método de la frecuencia cíclica
Artículo:
Creación de empresas y estrategia : reflexiones desde el enfoque de recursos
Libro:
Ergonomía en los sistemas de trabajo
Artículo:
La gestión de las relaciones con los clientes como característica de la alta rentabilidad empresarial
Artículo:
Los web services como herramienta generadora de valor en las organizaciones