PPaperPicks

Qi Tian

Huawei Noah's Ark Lab

42 papers at tracked venues · 36 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. A Principle-Driven Adaptive Policy for Group Cognitive Stimulation Dialogue for Elderly with Cognitive Impairment
  2. Dereflection Any Image with Diffusion Priors and Diversified Data
  3. Few-step Flow for 3D Generation via Marginal-Data Transport Distillation
  4. O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
  5. PairCoder: Pair Programming-Inspired Two-Agent Collaboration for Code Generation
  6. TheraMind: A Strategic and Adaptive Agent for Longitudinal Psychological Counseling
  7. WorldGrow: Generating Infinite 3D World
  8. Aligning Human Motion Generation with Human Perceptions
  9. Boosting Segment Anything Model Towards Open-Vocabulary Learning
  10. C-CLIP: Multimodal Continual Learning for Vision-Language Model
  11. CLIP-Adapted Region-to-Text Learning for Generative Open-Vocabulary Semantic Segmentation
  12. Diffusion-Driven Progressive Target Manipulation for Source-Free Domain Adaptation
  13. Efficient Multi-modal Long Context Learning for Training-free Adaptation
  14. Enhancing Pre-trained Representation Classifiability can Boost its Interpretability
  15. IM-Zero: Instance-level Motion Controllable Video Generation in a Zero-shot Manner
  16. Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
  17. METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
  18. MagCache: Fast Video Generation with Magnitude-Aware Cache
  19. SAM-CP: Marrying SAM with Composable Prompts for Versatile Segmentation
  20. Segment Any 3D Gaussians
  21. Tackling View-Dependent Semantics in 3D Language Gaussian Splatting
  22. 4D Gaussian Splatting for Real-Time Dynamic Scene Rendering
  23. AlignZeg: Mitigating Objective Misalignment for Zero-Shot Semantic Segmentation
  24. BarLeRIa: An Efficient Tuning Framework for Referring Image Segmentation
  25. Cascade-Zero123: One Image to Highly Consistent 3D with Self-prompted Nearby Views
  26. ControlVideo: Training-free Controllable Text-to-video Generation
  27. DomainFusion: Generalizing to Unseen Domains with Latent Diffusion Models
  28. Enhance Image Classification via Inter-Class Image Mixup with Diffusion Model
  29. GaussianDreamer: Fast Generation from Text to 3D Gaussians by Bridging 2D and 3D Diffusion Models
  30. GaussianEditor: Editing 3D Gaussians Delicately with Text Instructions
  31. HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction Data
  32. Hybrid Distillation: Connecting Masked Autoencoders with Contrastive Learners
  33. Improving Image Restoration Through Removing Degradations in Textual Representations
  34. Inner Classifier-Free Guidance and Its Taylor Expansion for Diffusion Models
  35. LION: Implicit Vision Prompt Tuning
  36. OVMR: Open-Vocabulary Recognition with Multi-Modal References
  37. Parameter Efficient Fine-Tuning via Cross Block Orchestration for Segment Anything Model
  38. PolyVoice: Language Models for Speech to Speech Translation
  39. Preliminary Study on Incremental Learning for Large Language Model-based Recommender Systems
  40. QA-LoRA: Quantization-Aware Low-Rank Adaptation of Large Language Models
  41. Towards 3D Molecule-Text Interpretation in Language Models
  42. UMG-CLIP: A Unified Multi-granularity Vision Generalist for Open-World Understanding