PPaperPicks

Jiebo Luo

University of Rochester, Department of Computer Science, NY, USA

50 papers at tracked venues · 44 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
  2. Enhancing Federated Class-Incremental Learning via Spatial-Temporal Statistics Aggregation
  3. Learning Cell-Aware Hierarchical Multi-Modal Representations for Robust Molecular Modeling
  4. QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
  5. RealUHR: Harnessing Patch-Cascade Flows for Photorealistic Ultra-High-Resolution Synthesis
  6. StreamSense: Streaming Social Task Detection with Selective Vision-Language Model Routing
  7. Aligning Global Semantics and Local Textures in Generative Video Enhancement
  8. Code to Think, Think to Code: A Survey on Code-Enhanced Reasoning and Reasoning-Driven Code Intelligence in LLMs
  9. Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics
  10. FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity
  11. Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning
  12. From Selection to Generation: A Survey of LLM-based Active Learning
  13. HOIGen-1M: A Large-scale Dataset for Human-Object Interaction Video Generation
  14. INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance
  15. Identity-Preserving Text-to-Video Generation by Frequency Decomposition
  16. Latent Chain-of-Thought for Visual Reasoning
  17. Latent-Reframe: Enabling Camera Control for Video Diffusion Models Without Training
  18. MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models
  19. Omnipaint: Mastering Object-Oriented Editing Via Disentangled Insertion-Removal Inpainting
  20. On Inductive Biases That Enable Generalization in Diffusion Transformers
  21. On Path to Multimodal Generalist: General-Level and General-Bench
  22. OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
  23. Ouroboros-Diffusion: Exploring Consistent Content Generation in Tuning-free Long Video Diffusion
  24. PP-Motion: Physical-Perceptual Fidelity Evaluation for Human Motion Generation
  25. PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement
  26. Representation Bias in Political Sample Simulations with Large Language Models
  27. SMPV: Social Media Prediction for Videos
  28. SafeCFG: Controlling Harmful Features with Dynamic Safe Guidance for Safe Generation
  29. Unleashing Hour-Scale Video Training for Long Video-Language Understanding
  30. V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
  31. Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
  32. BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical Analysis
  33. Bring Metric Functions into Diffusion Models
  34. ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
  35. Continuous-Multiple Image Outpainting in One-Step via Positional Query and A Diffusion-based Approach
  36. DanceCamAnimator: Keyframe-Based Controllable 3D Dance Camera Synthesis
  37. DanceCamera3D: 3D Camera Movement Synthesis with Music and Dance
  38. Deceptive Fairness Attacks on Graphs via Meta Learning
  39. Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
  40. FineMatch: Aspect-Based Fine-Grained Image and Text Mismatch Detection and Correction
  41. LLM-Rec: Personalized Recommendation via Prompting Large Language Models
  42. Large Multimodal Models as Social Multimedia Analysis Engines
    ACM MM 2024 · Jiebo Luo
  43. Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
  44. Mixture of Weak and Strong Experts on Graphs
  45. OpenLEAF: A Novel Benchmark for Open-Domain Interleaved Image-Text Generation
  46. PromptFix: You Prompt and We Fix the Photo
  47. SMP Challenge Summary: Social Media Prediction Challenge
  48. SoMeLVLM: A Large Vision Language Model for Social Media Processing
  49. SurgicalSAM: Efficient Class Promptable Surgical Instrument Segmentation
  50. Unifying Local and Global Knowledge: Empowering Large Language Models as Political Experts with Knowledge Graphs