PPaperPicks

Xiaodan Liang

70 papers at tracked venues · 55 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
  2. Video Spatial Reasoning with Object-Centric 3D Rollout
  3. X-SAM: From Segment Anything to Any Segmentation
  4. $A_{0}$: An Affordance-Aware Hierarchical Model for General Robotic Manipulation
  5. 3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering
  6. Affordances-Oriented Planning Using Foundation Models for Continuous Vision-Language Navigation
  7. BEV-TSR: Text-Scene Retrieval in BEV Space for Autonomous Driving
  8. CatVTON: Concatenation Is All You Need for Virtual Try-On with Diffusion Models
  9. Complementary Information Guided Occupancy Prediction via Multi-Level Representation Fusion
  10. DialogGen: Multi-modal Interactive Dialogue System with Multi-turn Text-Image Generation
  11. DisCo: Discovering Common Affordance from Large Models for Actionable Part Perception
  12. DreamFit: Garment-Centric Human Generation via a Lightweight Anything-Dressing Encoder
  13. EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions
  14. FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language Model
  15. GDrag: Towards General-Purpose Interactive Editing with Anti-ambiguity Point Diffusion
  16. Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra Data
  17. HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
  18. LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
  19. MUSE: Mamba Is Efficient Multi-scale Learner for Text-video Retrieval
  20. MineAnyBuild: Benchmarking Spatial Planning for Open-world AI Agents
  21. ORMind: A Cognitive-Inspired End-to-End Reasoning Framework for Operations Research
  22. OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
  23. OptiBench Meets ReSocratic: Measure and Improve LLMs for Optimization Modeling
  24. PT-T2I/V: An Efficient Proxy-Tokenized Diffusion Transformer for Text-to-Image/Video-Task
  25. PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly
  26. Realistic and Efficient Face Swapping: A Unified Approach with Diffusion Models
  27. RoBridge: A Hierarchical Architecture Bridging Cognition and Execution for General Robotic Manipulation
  28. RoboPearls: Editable Video Simulation for Robot Manipulation
  29. RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
  30. RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation
  31. S2-Track: A Simple yet Strong Approach for End-to-End 3D Multi-Object Tracking
  32. SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
  33. SeePhys: Does Seeing Help Thinking? - Benchmarking Vision-Based Physics Reasoning
  34. Sitcom-Crafter: A Plot-Driven Human Motion Generation System in 3D Scenes
  35. Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
  36. UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting
  37. WISA: World simulator assistant for physics-aware text-to-video generation
  38. 3D Visibility-Aware Generalizable Neural Radiance Fields for Interacting Hands
  39. APTNESS: Incorporating Appraisal Theory and Emotion Support Strategies for Empathetic Response Generation
  40. ATG: Benchmarking Automated Theorem Generation for Generative Language Models
  41. AlignMiF: Geometry-Aligned Multimodal Implicit Field for LiDAR-Camera Joint Synthesis
  42. AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations
  43. CLOMO: Counterfactual Logical Modification with Large Language Models
  44. Contrastive Learning with Counterfactual Explanations for Radiology Report Generation
  45. CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
  46. DQ-LoRe: Dual Queries with Low Rank Approximation Re-ranking for In-Context Learning
  47. DetCLIPv3: Towards Versatile Generative Open-Vocabulary Object Detection
  48. DreamVTON: Customizing 3D Virtual Try-on with Personalized Diffusion Models
  49. FVEL: Interactive Formal Verification Environment with Large Language Models via Theorem Proving
  50. GarmentAligner: Text-to-Garment Generation via Retrieval-Augmented Multi-level Corrections
  51. Holistic Autonomous Driving Understanding by Bird'View Injected Multi-Modal Large Models
  52. HumanRefiner: Benchmarking Abnormal Human Generation and Refining with Coarse-to-Fine Pose-Reversible Guidance
  53. Ins-DetCLIP: Aligning Detection Model to Follow Human-Language Instruction
  54. LEGO-Prover: Neural Theorem Proving with Growing Libraries
  55. LayerDiff: Exploring Text-Guided Multi-layered Composable Image Synthesis via Layer-Collaborative Diffusion Model
  56. Learning Interaction-aware 3D Gaussian Splatting for One-shot Hand Avatars
  57. LiDAR-NeRF: Novel LiDAR View Synthesis via Neural Radiance Fields
  58. MLP Can Be a Good Transformer Learner
  59. MUSTARD: Mastering Uniform Synthesis of Theorem and Proof Data
  60. Making Large Language Models Better Planners with Reasoning-Decision Alignment
  61. MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation
  62. Monocular 3D Hand Mesh Recovery via Dual Noise Estimation
  63. PIVOT-R: Primitive-Driven Waypoint-Aware World Model for Robotic Manipulation
  64. PTUS: Photo-Realistic Talking Upper-Body Synthesis via 3D-Aware Motion Decomposition Warping
  65. Proving Theorems Recursively
  66. RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated Adapter
  67. Towards Detailed Text-to-Motion Synthesis via Basic-to-Advanced Hierarchical Diffusion Model
  68. VidMan: Exploiting Implicit Dynamics from Video Diffusion Model for Effective Robot Manipulation
  69. VisDiaHalBench: A Visual Dialogue Benchmark For Diagnosing Hallucination in Large Vision-Language Models
  70. Web2Code: A Large-scale Webpage-to-Code Dataset and Evaluation Framework for Multimodal LLMs