PPaperPicks

Wenqi Shao

46 papers at tracked venues · 43 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
  2. Design First, Code Later: Aesthetically Pleasing Template-Free Slides Generation
  3. MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
  4. Cross-Subject Mind Decoding from Inaccurate Representations
  5. DexHandDiff: Interaction-aware Diffusion Planning for Adaptive Dexterous Manipulation
  6. DiffusionMat: Alpha Matting as Deterministic Sequential Refinement Learning
  7. Distilling Monocular Foundation Model for Fine-grained Depth Completion
  8. Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
  9. EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
  10. EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
  11. Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models
  12. GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
  13. HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model
  14. JiSAM: Alleviate Labeling Burden and Corner Case Problems in Autonomous Driving via Minimal Real-World Data
  15. Learning Dense Feature Matching via Lifting Single 2D Image to 3D Space
  16. LiT: Delving into a Simple Linear Diffusion Transformer for Image Generation
  17. Lumina-T2X: Scalable Flow-based Large Diffusion Transformer for Flexible Resolution Generation
  18. MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
  19. MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
  20. OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
  21. OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation
  22. Prompt-A-Video: Prompt your Video Diffusion Model via Preference-Aligned LLM
  23. SAMRefiner: Taming Segment Anything Model for Universal Mask Refinement
  24. TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
  25. TREND: Unsupervised 3D Representation Learning via Temporal Forecasting for LiDAR Perception
  26. Temporal Overlapping Prediction: A Self-Supervised Pre-Training Method for LiDAR Moving Object Segmentation
  27. Text2World: Benchmarking Large Language Models for Symbolic World Model Generation
  28. Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
  29. ZipVL: Accelerating Vision-Language Models Through Dynamic Token Sparsity
  30. BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
  31. Cached Transformers: Improving Transformers with Differentiable Memory Cachde
  32. ChartAssistant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
  33. ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Ablation Capability for Large Vision-Language Models
  34. DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
  35. GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
  36. MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
  37. Needle In A Multimodal Haystack
  38. OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
  39. OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
    ICLR 2024 · Wenqi Shao
  40. Position: Towards Implicit Prompt For Text-To-Image Models
  41. Rethinking Human Evaluation Protocol for Text-to-Video Models: Enhancing Reliability, Reproducibility, and Practicality
  42. RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis
  43. SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
  44. SPHINX: A Mixer of Weights, Visual Embeddings and Image Scales for Multi-modal Large Language Models
  45. SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
  46. Tree-Planner: Efficient Close-loop Task Planning with Large Language Models