PPaperPicks

Yu-Chiang Frank Wang

National Taiwan University, Vision and Learning Lab, Taipei City, Taiwan

40 papers at tracked venues · 29 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
  2. Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception
  3. TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors
  4. 3D Gaussian Inpainting with Depth-Guided Cross-View Consistency
  5. Bias in Gender Bias Benchmarks: How Spurious Features Distort Evaluation
  6. Continual Personalization for Diffusion Models
  7. Data-Efficient 3D Visual Grounding via Order-Aware Referring
  8. Dr. Splat: Directly Referring 3D Gaussian Splatting via Direct Language Embedding Registration
  9. EMLoC: Emulator-based Memory-efficient Fine-tuning with LoRA Correction
  10. LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
  11. Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation
  12. MotionMatcher: Cinematic Motion Customization of Text-to-Video Diffusion Models via Motion Feature Matching
  13. NeKo: Cross-Modality Post-Recognition Error Correction with Tasks-Guided Mixture-of-Experts Language Model
  14. Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks
  15. SANER: Annotation-free Societal Attribute Neutralizer for Debiasing CLIP
  16. Segment Anything, Even Occluded
  17. Semantic Prompt Learning for Weakly-Supervised Semantic Segmentation
  18. Serial Lifelong Editing via Mixture of Knowledge Experts
  19. Sparse Voxels Rasterization: Real-time High-fidelity Radiance Field Rendering
  20. ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
  21. UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing
  22. UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation
  23. Unified Reinforcement and Imitation Learning for Vision-Language Models
  24. Universal Speech Enhancement with Regression and Generative Mamba
  25. VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models
  26. VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models
  27. VoiceNoNG: Robust High-Quality Speech Editing Model without Hallucinations
  28. DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
  29. Diffusion-Reward Adversarial Imitation Learning
  30. DoRA: Weight-Decomposed Low-Rank Adaptation
  31. GSNeRF: Generalizable Semantic Neural Radiance Fields with Enhanced 3D Scene Understanding
  32. Language-Guided Transformer for Federated Multi-Label Classification
  33. RAPPER: Reinforced Rationale-Prompted Paradigm for Natural Language Explanation in Visual Question Answering
  34. ReXTime: A Benchmark Suite for Reasoning-Across-Time in Videos
  35. Receler: Reliable Concept Erasing of Text-to-Image Diffusion Models via Lightweight Erasers
  36. SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
  37. Seg2Reg: Differentiable 2D Segmentation to 1D Regression Rendering for 360 Room Layout Reconstruction
  38. Select and Distill: Selective Dual-Teacher Knowledge Transfer for Continual Learning on Vision-Language Models
  39. Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech
  40. TPA3D: Triplane Attention for Fast Text-to-3D Generation