维普中文期刊产品整合服务

基于Viseme的连续语音识别系统及Talking Head

查看全文 作  者:[1]蒋冬梅;[1]谢磊;Ilse [2]Ravyse;[1]赵荣椿;Hichem [2]Sahli;Jan [2]Cornelis 高影响力作者 机构地区:[1]西北工业大学计算机科学与工程系,西安710072;[2]DeptETRO,FreeUniversityBrussels,Pleinlaan2,B-1050,Brussels,Belgium高影响力机构 出  处:《电子与信息学报》索引2004年第26卷第3期,共7页高影响力期刊 基  金:中国科技部与比利时弗拉芒大区科技合作项目资助课题(国科外字1999(0209号)) 摘  要:为实现听觉/视觉驱动的说话人头部动画,该文给出了一个基于viseme(说话时的基本嘴形单位)的连续语音识别系统。它训练viseme隐马尔可夫模型(HMM),识别语音为viseme图像序列。建模采用triseme的概念来考虑viseme的上下文相关性,但它需要超大量的训练数据。该文根据viseme图像及其相似度权值(VSW)定义视觉问题集,用来建立triseme决策树,以实现triseme的状态捆绑及HMM参数共享。为比较系统性能,基于phoneme(听觉领域的语音基本单位)的语音识别结果也被映射为viseme序列。在评价准则上,定义viseme图像相似度加权识别精度,更全面地考虑输出和参考图像序列的差别,并用嘴形圆度和VSW曲线中的突变点来评估所得viseme序列的平滑性。结果表明,基于viseme的语音识别系统能给出更平滑和合理的嘴形图像序列。 关 键 词:说话人头部动画 Viseme 连续语音识别 Triseme决策树 图像相似度加权 嘴形圆度
相关文献

参考文献(6)

引证文献(3)

网站首页 | 关于我们 | 联系我们 | 产品服务 | 客服中心 | 广告服务 | 版权声明 | 网站联盟 | 友情链接 | 售卡网点

版权所有© 渝B2-20050021-1 渝公网安备 50019002500403号 违法和不良信息举报中心

互联网出版许可证 新出网证(渝)字10号 全国400电话 - 免长途话费