PPaperPicks

Jun Zhu

Tsinghua University, State Key Laboratory of Intelligent Technology and Systems, TNList, Beijing, China

65 papers at tracked venues · 60 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Benchmarking Trustworthiness in Multimodal LLMs for Video Understanding
  2. ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
  3. H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation
  4. A Regularized Newton Method for Nonconvex Optimization with Global and Local Complexity Guarantees
  5. Audio Super-Resolution with Latent Bridge Models
  6. DeepMesh: Auto-Regressive Artist-Mesh Creation with Reinforcement Learning
  7. Diffusion Bridge Implicit Models
  8. Dimensionx: Create Any 3D and 4D Scenes From a Single Image With Decoupled Video Diffusion
  9. Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator
  10. Elucidating the Preconditioning in Consistency Distillation
  11. Fairness without Demographics through Learning Graph of Gradients
  12. FrameBridge: Improving Image-to-Video Generation with Bridge Models
  13. FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
  14. Improving Accuracy and Calibration via Differentiated Deep Mutual Learning
  15. Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling
  16. MeshAnything V2: Artist-Created Mesh Generation with Adjacent Mesh Tokenization
  17. On the Optimization and Generalization of Two-layer Transformers with Sign Gradient Descent
  18. Oscillation-Reduced MXFP4 Training for Vision Transformers
  19. Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
  20. RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
  21. RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers
  22. ReMoE: Fully Differentiable Mixture-of-Experts with ReLU Routing
  23. Robust Representation Consistency Model via Contrastive Denoising
  24. STAIR: Improving Safety Alignment with Introspective Reasoning
  25. SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization
  26. SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training
  27. SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference Acceleration
  28. Scaling Diffusion Transformers Efficiently via μP
  29. Self-Consistent Model-based Adaptation for Visual Reinforcement Learning
  30. ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
  31. SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
  32. Toward Guidance-Free AR Visual Generation via Condition Contrastive Alignment
  33. Visual Generation Without Guidance
  34. Accelerating Transformer Pre-training with 2: 4 Sparsity
  35. Aligning Diffusion Behaviors with Q-functions for Efficient Continuous Control
  36. C-GAIL: Stabilizing Generative Adversarial Imitation Learning with Control Theory
  37. CRM: Single Image to 3D Textured Mesh with Convolutional Reconstruction Model
  38. Consistency Diffusion Bridge Models
  39. DGPO: Discovering Multiple Strategies with Diversity-Guided Policy Optimization
  40. DPOT: Auto-Regressive Denoising Operator Transformer for Large-Scale PDE Pre-Training
  41. Diffusion Models are Certifiably Robust Classifiers
  42. DreamReward: Text-to-3D Generation with Human Preference
  43. Efficient Backpropagation with Variance Controlled Adaptive Sampling
  44. Efficient Black-box Adversarial Attacks via Bayesian Optimization Guided by a Function Prior
  45. Embodied Active Defense: Leveraging Recurrent Feedback to Counter Adversarial Patches
  46. Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
  47. FeedFace: Efficient Inference-based Face Personalization via Diffusion Models
  48. Fourier Controller Networks for Real-Time Decision-Making in Embodied Learning
  49. Grounding DINO: Marrying DINO with Grounded Pre-training for Open-Set Object Detection
  50. Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
  51. InstructPix2NeRF: Instructed 3D Portrait Editing from a Single Image
  52. Jetfire: Efficient and Accurate Transformer Pretraining with INT8 Data Flow and Per-Block Quantization
  53. LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents
  54. MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
  55. Noise Contrastive Alignment of Language Models with Explicit Rewards
  56. On Mesa-Optimization in Autoregressively Trained Transformers: Emergence and Capability
  57. PEAC: Unsupervised Pre-training for Cross-Embodiment Reinforcement Learning
  58. PINNacle: A Comprehensive Benchmark of Physics-Informed Neural Networks for Solving PDEs
  59. Rethinking Model Ensemble in Transfer-based Adversarial Attacks
  60. Robust Classification via a Single Diffusion Model
  61. S-STE: Continuous Pruning Function for Efficient 2: 4 Sparse Pre-training
  62. Score Regularized Policy Optimization through Diffusion Behavior
  63. T2VSafetyBench: Evaluating the Safety of Text-to-Video Generative Models
  64. Towards Efficient Exact Optimization of Language Model Alignment
  65. Vidu4D: Single Generated Video to High-Fidelity 4D Reconstruction with Dynamic Gaussian Surfels