Time-varying quasi-closed-phase analysis for accurate formant tracking in speech signals

Dhananjaya Gowda, Sudarsana Kadiri*, Brad Story, Paavo Alku

*Tämän työn vastaava kirjoittaja

    Tutkimustuotos: LehtiartikkeliArticleScientificvertaisarvioitu

    9 Sitaatiot (Scopus)
    154 Lataukset (Pure)

    Abstrakti

    In this paper, we propose a new method for the accurate estimation and tracking of formants in speech signals using time-varying quasi-closed-phase (TVQCP) analysis. Con-ventional formant tracking methods typically adopt a two-stage estimate-and-track strategy wherein an initial set of formant candidates are estimated using short-time analysis (e.g., 10–50 ms), followed by a tracking stage based on dynamic programming or a linear state-space model. One of the main disadvantages of these approaches is that the tracking stage, however good it may be, cannot improve upon the formant estimation accuracy of the first stage. The proposed TVQCP method provides a single-stage formant tracking that combines the estimation and tracking stages into one. TVQCP analysis combines three approaches to improve formant estimation and tracking: (1) it uses temporally weighted quasi-closed-phase analysis to derive closed-phase es-timates of the vocal tract with reduced interference from the excitation source, (2) it increases the residual sparsity by using the L1 optimization and (3) it uses time-varying linear prediction analysis over long time windows (e.g., 100–200 ms) to impose a continuity constraint on the vocal tract model and hence on the formant trajectories. Formant tracking experiments with a wide variety of synthetic and natural speech signals show that the proposed TVQCP method performs better than conventional and popular formant tracking tools, such as Wavesurfer and Praat (based on dynamic programming), the KARMA algorithm (based on Kalman filtering), and DeepFormants (based on deep neural networks trained in a supervised manner).
    AlkuperäiskieliEnglanti
    Artikkeli9108548
    Sivut1901-1914
    Sivumäärä14
    JulkaisuIEEE/ACM Transactions on Audio, Speech, and Language Processing
    Vuosikerta28
    DOI - pysyväislinkit
    TilaJulkaistu - 4 kesäk. 2020
    OKM-julkaisutyyppiA1 Alkuperäisartikkeli tieteellisessä aikakauslehdessä

    Sormenjälki

    Sukella tutkimusaiheisiin 'Time-varying quasi-closed-phase analysis for accurate formant tracking in speech signals'. Ne muodostavat yhdessä ainutlaatuisen sormenjäljen.
    • Poikkitieteellinen parametrisen puhesynteesin tutkimusprojekti

      Alku, P. (Vastuullinen tutkija), Bäckström, T. (Projektin jäsen), Juvela, L. (Projektin jäsen), Murtola, T. (Projektin jäsen), Nonavinakere Prabhakera, N. (Projektin jäsen), Bollepalli, B. (Projektin jäsen) & Airaksinen, M. (Projektin jäsen)

      01/01/201831/12/2019

      Projekti: Academy of Finland: Other research funding

    • Poikkitieteellinen parametrisen puhesynteesin tutkimusprojekti

      Juvela, L. (Projektin jäsen), Bäckström, T. (Projektin jäsen), Pohjalainen, J. (Projektin jäsen), Gowda, D. (Projektin jäsen), Jokinen, E. (Projektin jäsen), Alku, P. (Vastuullinen tutkija), Bollepalli, B. (Projektin jäsen), Saeidi, R. (Projektin jäsen), Raitio, T. (Projektin jäsen), Kakouros, S. (Projektin jäsen) & Airaksinen, M. (Projektin jäsen)

      01/01/201531/12/2017

      Projekti: Academy of Finland: Other research funding

    Siteeraa tätä