跳至内容
  • 首页
  • 资讯
  • 资源下载
  • 行业方案
  • Job招聘
  • Paper论文
  • Patent专利
  • 映维会员
  • 导航收录
  • 合作
  • 关于
  • 微信群
  • All
  • XR
  • CV
  • CG
  • HCI
  • Video
  • Optics
  • Perception
  • Reconstruction

LaDTalk: Latent Denoising for Synthesizing Talking Head Videos with High Frequency Details

编辑:广东客   |   分类:CV   |   2025年2月27日

Note: We don't have the ability to review paper

PubDate: Feb 2025

Teams:Beihang University, Beijing Academy of Blockchain and Edge Computing, Psyche AI,The University of Alabama at Birmingham

Writers:Jian Yang, Xukun Wang, Wentao Wang, Guoming Li, Qihang Fang, Ruihong Yuan, Tianyang Wang, Jason Zhaoxin Fan

PDF:LaDTalk: Latent Denoising for Synthesizing Talking Head Videos with High Frequency Details

Abstract

Audio-driven talking head generation is a pivotal area within film-making and Virtual Reality. Although existing methods have made significant strides following the end-to-end paradigm, they still encounter challenges in producing videos with high-frequency details due to their limited expressivity in this domain. This limitation has prompted us to explore an effective post-processing approach to synthesize photo-realistic talking head videos. Specifically, we employ a pretrained Wav2Lip model as our foundation model, leveraging its robust audio-lip alignment capabilities. Drawing on the theory of Lipschitz Continuity, we have theoretically established the noise robustness of Vector Quantised Auto Encoders (VQAEs). Our experiments further demonstrate that the high-frequency texture deficiency of the foundation model can be temporally consistently recovered by the Space-Optimised Vector Quantised Auto Encoder (SOVQAE) we introduced, thereby facilitating the creation of realistic talking head videos. We conduct experiments on both the conventional dataset and the High-Frequency TalKing head (HFTK) dataset that we curated. The results indicate that our method, LaDTalk, achieves new state-of-the-art video quality and out-of-domain lip synchronization performance.

本文链接:https://paper.nweon.com/16220

您可能还喜欢...

  • c8a4d62d321b3badf5ed8f4cf7665efb-thumb-medium

    Realistic training in VR using physical manipulation

    2020年06月22日 映维

  • be7f3788b8a4a498787d5c3eb401baec-thumb-medium

    INSAR: indoor navigation system using augmented reality

    2020年07月14日 映维

  • 44e4bb1c435801c7a55f1303762b6bb8-thumb-medium

    Lightweight Monocular Depth Estimation Model by Joint End-to-End Filter pruning

    2020年08月10日 映维

关注:

最新AR/VR行业分享

  • ★ 映维日报:Quest 3S历史低价200美元,深圳文旅公司697万元招标龙川VR影片制作 2025年11月18日
  • ★ 谷歌XR专利分享实时后台眼动追踪校准技术 2025年11月18日
  • ★ Lumus与Snke合作,共推医疗级AR眼镜 2025年11月18日
  • ★ Meta Quest 3S历史低价199.99美元,再送12个月Horizon+订阅 2025年11月18日
  • ★ Red 6与波音联手,AR训练系统首次落地阿帕奇旋翼机 2025年11月18日

最新AR/VR专利

  • ★ Samsung Patent | Augmented reality wearable electronic device 2025年11月13日
  • ★ Samsung Patent | Wearable electronic device comprising plurality of displays, and method for controlling same 2025年11月13日
  • ★ Snap Patent | Display device with optical waveguide and projector 2025年11月13日
  • ★ MagicLeap Patent | Eyepieces for augmented reality display system 2025年11月13日
  • ★ MagicLeap Patent | Highly transmissive eyepiece architecture 2025年11月13日

最新AR/VR行业招聘

  • ★ Microsoft AR/VR Job | High Performance Compute, Director 2025年6月5日
  • ★ Microsoft AR/VR Job | Data Center Technician/ Technicien de Centre de Données 2025年6月3日
  • ★ Microsoft AR/VR Job | Senior Product Designer 2025年5月16日
  • ★ Apple AR/VR Job | AirPlay Audio Engineer 2025年3月27日
  • ★ Apple AR/VR Job | iOS Perception Engineer 2025年3月27日
  • 首页
  • 资讯
  • 资源下载
  • 行业方案
  • Job招聘
  • Paper论文
  • Patent专利
  • 映维会员
  • 导航收录
  • 合作
  • 关于
  • 微信群

联系微信:ovalics

版权所有:广州映维网络有限公司 © 2025

备案许可:粤ICP备17113731号-2

备案粤公网安备:44011302004835号

友情链接: AR/VR行业导航

读者QQ群:251118691

Quest QQ群:526200310

开发者QQ群:688769630

Paper