PPaperPicks

Can Qin

13 papers at tracked venues · 10 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. DcSplat: Dual-Constraint Human Gaussian Splatting with Latent Multi-View Consistency
  2. Hybrid Vector-Occupancy Field for Robust Implicit 3D Surface Reconstruction
  3. BLIP-3: A Family of Open Large Multimodal Models
  4. Disentangled Pose and Appearance Guidance for Multi-Pose Generation
  5. DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
  6. HoliTom: Holistic Token Merging for Fast Video Large Language Models
  7. Structured Policy Optimization: Enhance Large Vision-Language Model via Self-Referenced Dialogue
  8. Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
  9. HIVE: Harnessing Human Feedback for Instructional Visual Editing
  10. M3SOT: Multi-Frame, Multi-Field, Multi-Space 3D Single Object Tracking
  11. SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
  12. Self-Training Large Language and Vision Assistant for Medical Question Answering
  13. xGen-VideoSyn-1: High-Fidelity Text-to-Video Synthesis with Compressed Representations
    ECCV 2024 · Can Qin