PPaperPicks

Kaipeng Zhang

41 papers at tracked venues · 38 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces
  2. MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
  3. MeepleLM: A Virtual Playtester Simulating Diverse Subjective Experiences
  4. Navigating Truth in Multimodal Fact-checking via Retrieval- and Reasoning-Enhanced Large Language Models
  5. Uncertainty-Calibrated Elastic Alignment for Multimodal Sentiment Analysis with Missing Modalities
  6. Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
  7. EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
  8. GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
  9. InMind: Evaluating LLMs in Capturing and Applying Individual Human Reasoning Styles
  10. LiT: Delving into a Simple Linear Diffusion Transformer for Image Generation
  11. MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
  12. MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
  13. Neighboring Autoregressive Modeling for Efficient Visual Generation
  14. Neural-Driven Image Editing
  15. OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation
  16. ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for Mllm-Based Process Judges
  17. REPA Works Until It Doesn't: Early-Stopped, Holistic Alignment Supercharges Diffusion Training
  18. SAMRefiner: Taming Segment Anything Model for Universal Mask Refinement
  19. Sekai: A Video Dataset towards World Exploration
  20. TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
  21. To Think or Not To Think: A Study of Thinking in Rule-Based Visual Reinforcement Fine-Tuning
  22. Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
  23. ZipAR: Parallel Autoregressive Image Generation through Spatial Locality
  24. ZipVL: Accelerating Vision-Language Models Through Dynamic Token Sparsity
  25. BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
  26. ChartAssistant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
  27. ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Ablation Capability for Large Vision-Language Models
  28. Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
  29. DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
  30. Lumina-Next : Making Lumina-T2X Stronger and Faster with Next-DiT
  31. MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
  32. Needle In A Multimodal Haystack
  33. OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
  34. OneLLM: One Framework to Align All Modalities with Language
  35. Position: Towards Implicit Prompt For Text-To-Image Models
  36. Rethinking Human Evaluation Protocol for Text-to-Video Models: Enhancing Reliability, Reproducibility, and Practicality
  37. SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
  38. SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
  39. T3M: Text Guided 3D Human Motion Synthesis from Speech
  40. TagCLIP: A Local-to-Global Framework to Enhance Open-Vocabulary Multi-Label Classification of CLIP without Training
  41. Towards Lossless Dataset Distillation via Difficulty-Aligned Trajectory Matching