PPaperPicks

Haonan Lu

23 papers at tracked venues · 17 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Aligning Cross-View Visual Geometries in LVLMs Through Human-Like Reasoning Learning
  2. Click-to-Ask: An AI Live Streaming Assistant with Offline Copywriting and Online Interactive QA
  3. DRIFT: Difference-Aware Reinforcement Through Iterative Fine-Tuning for Language Model
  4. DaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone Agents
  5. Mobile-Agent-RAG: Driving Smart Multi-Agent Coordination with Contextual Knowledge Empowerment for Long-Horizon Mobile Automation
  6. OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
  7. X2Edit: Revisiting Arbitrary-Instruction Image Editing Through Self-Constructed Data and Task-Aware Representation Learning
  8. Advancing Text-to-3D Generation with Linearized Lookahead Variational Score Distillation
  9. Free-Moref: Instantly Multiplexing Context Perception Capabilities of Video-Mllms Within Single Inference
  10. GlyphDraw2: Automatic Generation of Complex Glyph Posters with Diffusion Models and Large Language Models
  11. HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator
  12. InstructHOI: Context-Aware Instruction for Multi-Modal Reasoning in Human-Object Interaction Detection
  13. MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization
  14. MsRAG: Knowledge Augumented Image Captioning with Object-level Multi-source RAG
  15. SCott: Accelerating Diffusion Models with Stochastic Consistency Distillation
  16. X2i: Seamless Integration of Multimodal Understanding Into Diffusion Transformer Via Attention Distillation
  17. An Evaluation Mechanism of LLM-based Agents on Manipulating APIs
  18. Compositional Text-to-Image Synthesis with Attention Map Control of Diffusion Models
  19. InsCL: A Data-efficient Continual Learning Paradigm for Fine-tuning Large Language Models with Instructions
  20. MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval
  21. PEA-Diffusion: Parameter-Efficient Adapter with Knowledge Distillation in Non-english Text-to-Image Generation
  22. Probing Language Models for Pre-training Data Detection
  23. Prompt Space Optimizing Few-shot Reasoning Success with Large Language Models