Time-Frequency Energy Features for Articulator Position Inference on Stop Consonants
Características de tiempo-frecuencia para la estimación de la posición de los órganos articuladores en consonantes explosivas
La inversión articulatoria ofrece nuevas perspectivas y aplicaciones interesantes en el campo de la voz; sin embargo, es aún un problema por resolver. El presente trabajo ofrece un método para la estimación de la distribución de la información articulatoria contenida en la acústica de consonantes explosivas, cuya parametrización se realiza mediante la transformada wavelet packet. El trabajo se centra principalmente en estimar la información acústica relevante, en términos de asociación estadística, para la inferencia de la posición de los órganos articuladores críticos involucrados en la producción de consonantes explosivas. Se usa el coeficiente de Kendall a modo de medida de relevancia. Los mapas de relevancia de tiempo-frecuencia se calculan para la base de datos MOCHA–TIMIT; de la cual, las zonas correspondientes a las consonantes explosivas son analizados. El método propuesto entrega un conjunto de componentes de tiempo-frecuencia intimamente relacionados al fenómeno articulatorio, lo cual ofrece un entendimiento más profundo de la relación existente entre los fenómenos articulatorio y acústico. Los mapas de relevancia se prueban en un sistema de inversión articulatoria basado en modelos de mezclas gausianas, donde se muestra que mejoran el desempeño de los mencionados sistemas aplicados sobre consonantes explosivas. El método se puede extender a otras categorías articulatorias, p.e. fricativas, con el fin de adaptar el presente método a sistemas de inversión articulatoria sobre voz continua.
1 INTRODUCCIÓN
La inferencia de la posición de los articuladores, a partir de la información acústica contenida en la señal del habla, ofrece nuevas perspectivas e interesantes aplicaciones en el campo del procesamiento del habla. Un sistema adecuado para recuperar las configuraciones articulatorias, a partir de la señal acústica del habla, podría utilizarse en varias aplicaciones: ayudas visuales en tareas de entrenamiento articulatorio para personas con problemas de audición o de habla; programas de aprendizaje de segundas lenguas guiados por ordenador para mostrar la pronunciación correcta e incorrecta [1]; codificación de baja tasa de bits, ya que los articuladores se mueven de forma relativamente lenta [2]; y representación complementaria en los sistemas de reconocimiento del habla para mejorar su rendimiento, ya que los parámetros articulatorios representan mejor los fenómenos relacionados con la coarticulación [3].
Los gestos del habla son movimientos planificados en una secuencia coordinada, cuyas acciones son relativamente lentas y se solapan.
Recursos
-
Formatopdf
-
Idioma:inglés
-
Tamaño:354 kb