SwePub
Sök i LIBRIS databas

  Utökad sökning

WFRF:(Mendelson M)
 

Sökning: WFRF:(Mendelson M) > Beyond the listenin...

  • Mendelson, JosephKTH,Tal, musik och hörsel, TMH (författare)

Beyond the listening test : An interactive approach to TTS Evaluation

  • Artikel/kapitelEngelska2017

Förlag, utgivningsår, omfång ...

  • International Speech Communication Association,2017
  • printrdacarrier

Nummerbeteckningar

  • LIBRIS-ID:oai:DiVA.org:kth-220753
  • https://urn.kb.se/resolve?urn=urn:nbn:se:kth:diva-220753URI
  • https://doi.org/10.21437/Interspeech.2017-1438DOI

Kompletterande språkuppgifter

  • Språk:engelska
  • Sammanfattning på:engelska

Ingår i deldatabas

Klassifikation

  • Ämneskategori:ref swepub-contenttype
  • Ämneskategori:kon swepub-publicationtype

Anmärkningar

  • QC 20180105
  • Traditionally, subjective text-To-speech (TTS) evaluation is performed through audio-only listening tests, where participants evaluate unrelated, context-free utterances. The ecological validity of these tests is questionable, as they do not represent real-world end-use scenarios. In this paper, we examine a novel approach to TTS evaluation in an imagined end-use, via a complex interaction with an avatar. 6 different voice conditions were tested: Natural speech, Unit Selection and Parametric Synthesis, in neutral and expressive realizations. Results were compared to a traditional audio-only evaluation baseline. Participants in both studies rated the voices for naturalness and expressivity. The baseline study showed canonical results for naturalness: Natural speech scored highest, followed by Unit Selection, then Parametric synthesis. Expressivity was clearly distinguishable in all conditions. In the avatar interaction study, participants rated naturalness in the same order as the baseline, though with smaller effect size; expressivity was not distinguishable. Further, no significant correlations were found between cognitive or affective responses and any voice conditions. This highlights 2 primary challenges in designing more valid TTS evaluations: in real-world use-cases involving interaction, listeners generally interact with a single voice, making comparative analysis unfeasible, and in complex interactions, the context and content may confound perception of voice quality.

Ämnesord och genrebeteckningar

Biuppslag (personer, institutioner, konferenser, titlar ...)

  • Aylett, M. (författare)
  • KTHTal, musik och hörsel, TMH (creator_code:org_t)

Sammanhörande titlar

  • Ingår i:Proceedings of the Annual Conference of the International Speech Communication Association, INTERSPEECH: International Speech Communication Association, s. 249-253

Internetlänk

Till lärosätets databas

Hitta mer i SwePub

Av författaren/redakt...
Mendelson, Josep ...
Aylett, M.
Om ämnet
NATURVETENSKAP
NATURVETENSKAP
och Data och informa ...
och Människa datorin ...
Artiklar i publikationen
Av lärosätet
Kungliga Tekniska Högskolan

Sök utanför SwePub

Kungliga biblioteket hanterar dina personuppgifter i enlighet med EU:s dataskyddsförordning (2018), GDPR. Läs mer om hur det funkar här.
Så här hanterar KB dina uppgifter vid användning av denna tjänst.

 
pil uppåt Stäng

Kopiera och spara länken för att återkomma till aktuell vy