跳至内容
  • 首页
  • 资讯
  • 行业方案
  • 付费阅读
  • Job招聘
  • Paper论文
  • Patent专利
  • 映维会员
  • 导航收录
  • 合作
  • 关于
  • 微信群
  • All
  • XR
  • CV
  • CG
  • HCI
  • Video
  • Optics
  • Perception
  • Reconstruction
空 挡 广 告 位 | 空 挡 广 告 位

3D Vision-Language Gaussian Splatting

小编 广东客   |   分类:CV   |   2025年3月6日

Note: We don't have the ability to review paper

PubDate: Otc 2024

Teams:University of Central Florida;United Imaging Intelligence, Boston MA

Writers:Qucheng Peng, Benjamin Planche, Zhongpai Gao, Meng Zheng, Anwesa Choudhuri, Terrence Chen, Chen Chen, Ziyan Wu

PDF:3D Vision-Language Gaussian Splatting

Abstract

Recent advancements in 3D reconstruction methods and vision-language models have propelled the development of multi-modal 3D scene understanding, which has vital applications in robotics, autonomous driving, and virtual/augmented reality. However, current multi-modal scene understanding approaches have naively embedded semantic representations into 3D reconstruction methods without striking a balance between visual and language modalities, which leads to unsatisfying semantic rasterization of translucent or reflective objects, as well as over-fitting on color modality. To alleviate these limitations, we propose a solution that adequately handles the distinct visual and semantic modalities, i.e., a 3D vision-language Gaussian splatting model for scene understanding, to put emphasis on the representation learning of language modality. We propose a novel cross-modal rasterizer, using modality fusion along with a smoothed semantic indicator for enhancing semantic rasterization. We also employ a camera-view blending technique to improve semantic consistency between existing and synthesized views, thereby effectively mitigating over-fitting. Extensive experiments demonstrate that our method achieves state-of-the-art performance in open-vocabulary semantic segmentation, surpassing existing methods by a significant margin.

本文链接:https://paper.nweon.com/16233

标签: Intel

您可能还喜欢...

  • Sociotechnical Considerations for SLAM Anchors in Location-Based AR

    2024年09月25日 映维

  • BodyMap: Learning Full-Body Dense Correspondence Map

    2023年01月31日 映维

  • iHuman3D: Intelligent Human Body 3D Reconstruction using a Single Flying Camera

    2020年06月15日 映维

关注:

RSS 最新AR/VR行业分享

  • XR日报:斯坦福30年VR研究发现总结,微软专利解决MR头显漏光 2025年5月26日
  • 加拿大VR Vision发布PICO头显企业用户操作教程 2025年5月26日
  • 微软新型波导组合器专利解决MR头显光泄漏问题 2025年5月26日
  • 足球守门模拟游戏《Cleansheet Pro》将登陆Quest和PICO平台 2025年5月26日
  • 斯坦福大学三十年VR研究的五大发现:临场感、化身、培训、追踪、移动距离 2025年5月26日

RSS 最新AR/VR专利

  • Samsung Patent | Xr device, electronic device and control method thereof 2025年5月22日
  • Apple Patent | Suppression of hand gestures upon detection of peripheral events on a peripheral device 2025年5月22日
  • Ultraleap Patent | Systems and methods for machine control 2025年5月22日
  • Sony Patent | Information processing apparatus and information processing method 2025年5月22日
  • HTC Patent | Wearable device, gesture recognition method and non-transitory computer readable storage medium thereof 2025年5月22日

RSS 最新AR/VR行业招聘

  • Apple AR/VR Job | Senior Software QA Engineer - Apple Vision Pro 2024年11月12日
  • Apple AR/VR Job | System Product Design Engineer - Apple Vision Pro 2024年11月12日
  • Microsoft AR/VR Job | Principal Software Engineer -Teams Premium Services 2024年11月12日
  • Meta AR/VR Job | Software Engineer - XR Codec Interactions and Avatars Team 2024年11月12日
  • Meta AR/VR Job | Product Cost Engineer 2024年11月12日

联系微信:ovalics

版权所有:广州映维网络有限公司 © 2025

备案许可:粤ICP备17113731号-2

粤公网安备 44011302004835号

友情链接: AR/VR行业导航

读者QQ群:251118691

Quest QQ群:526200310

开发者QQ群:688769630

Paper