PPaperPicks

Jingdong Wang

Baidu, AI Group, Sunnyvale, CA, USA

56 papers at tracked venues · 43 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens
  2. Action Detail Matters: Refining Video Recognition with Local Action Queries
  3. Are Images Indistinguishable to Humans Also Indistinguishable to Classifiers?
  4. AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers
  5. Continual SFT Matches Multimodal RLHF with Negative Supervision
  6. DGTR: Distributed Gaussian Turbo-Reconstruction for Sparse-View Vast Scenes
  7. DynaMind: Reasoning over Abstract Video Dynamics for Embodied Decision-Making
  8. Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation
  9. Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer
  10. Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
  11. Learning Multiple Probabilistic Decisions from Latent World Model in Autonomous Driving
  12. MGMapNet: Multi-Granularity Representation Learning for End-to-End Vectorized HD Map Construction
  13. Manifold Constraint Reduces Exposure Bias in Accelerated Diffusion Sampling
  14. MonoLift: Learning 3D Manipulation Policies from Monocular RGB via Distillation
  15. OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation
  16. Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model
  17. SpotActor: Training-Free Layout-Controlled Consistent Image Generation
  18. TexGarment: Consistent Garment UV Texture Generation via Efficient 3D Structure-Guided Diffusion Transformer
  19. TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
  20. VidEvo: Evolving Video Editing through Exhaustive Temporal Modeling
  21. VoxelSplat: Dynamic Gaussian Splatting as an Effective Loss for Occupancy and Flow Prediction
  22. 3D-Aware Text-Driven Talking Avatar Generation
  23. A Multimodal, Multi-Task Adapting Framework for Video Action Recognition
  24. Automated Multi-level Preference for MLLMs
  25. BEVSpread: Spread Voxel Pooling for Bird's-Eye-View Representation in Vision-Based Roadside 3D Object Detection
  26. Decoupled Pseudo-Labeling for Semi-Supervised Monocular 3D Object Detection
  27. Dense Connector for MLLMs
  28. Evaluation of Text-to-Video Generation Models: A Dynamics Perspective
  29. Flipped Classroom: Aligning Teacher Attention with Student in Generalized Category Discovery
  30. Forgery-aware Adaptive Transformer for Generalizable Synthetic Image Detection
  31. GGRt: Towards Pose-Free Generalizable 3D Gaussian Splatting in Real-Time
  32. GP-NeRF: Generalized Perception NeRF for Context-Aware 3D Scene Understanding
  33. Generating Action-conditioned Prompts for Open-vocabulary Video Action Recognition
  34. IRGen: Generative Modeling for Image Retrieval
  35. Interactive 3D Object Detection with Prompts
  36. LION: Linear Group RNN for 3D Object Detection in Point Clouds
  37. LaMI-DETR: Open-Vocabulary Detection with Language Model Instruction
  38. Learning to Rematch Mismatched Pairs for Robust Cross-Modal Retrieval
  39. MS-DETR: Efficient DETR Training with Mixed Supervision
  40. Make Your ViT-Based Multi-view 3D Detectors Faster via Token Compression
  41. MoLE: Enhancing Human-centric Text-to-image Diffusion via Mixture of Low-rank Experts
  42. Mobile Attention: Mobile-Friendly Linear-Attention for Vision Transformers
  43. Multi-Domain Incremental Learning for Face Presentation Attack Detection
  44. Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation
  45. OPEN: Object-Wise Position Embedding for Multi-view 3D Object Detection
  46. Octopus: A Multi-modal LLM with Parallel Recognition and Sequential Understanding
  47. OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding
  48. PLIP: Language-Image Pre-training for Person Representation Learning
  49. ReSyncer: Rewiring Style-Based Generator for Unified Audio-Visually Synced Facial Performer
  50. SEED: A Simple and Effective 3D DETR in Point Clouds
  51. SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-Form Layout-to-Image Generation
  52. Schedule Your Edit: A Simple yet Effective Diffusion Noise Schedule for Image Editing
  53. ShowMaker: Creating High-Fidelity 2D Human Video via Fine-Grained Diffusion Modeling
  54. Timestep-Aware Correction for Quantized Diffusion Models
  55. Towards Unified Multi-granularity Text Detection with Interactive Attention
  56. VRP-SAM: SAM with Visual Reference Prompt