PPaperPicks

Ruihua Song

Renmin University of China, Beijing, China

20 papers at tracked venues · 16 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing
  2. Animate and Sound an Image
  3. ETVA: Evaluation of Text-to-Video Alignment via Fine-Grained Question Generation and Answering
  4. Enhancing Audiovisual Speech Recognition Through Bifocal Preference Optimization
  5. EyEar: Learning Audio Synchronized Human Gaze Trajectory Based on Physics-Informed Dynamics
  6. GALAXY: A Large-Scale Open-Domain Dataset for Multimodal Learning
  7. Select, Read, and Write: A Multi-Agent Framework of Full-Text-based Related Work Generation
  8. Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
  9. Think Then React: Towards Unconstrained Action-to-Reaction Motion Generation
  10. Towards Effective and Efficient Continual Pre-training of Large Language Models
  11. Transferring Foundation Models for Generalizable Robotic Manipulation
  12. VAFlow: Video-to-Audio Generation with Cross-Modality Flow Matching
  13. BSharedRAG: Backbone Shared Retrieval-Augmented Generation for the E-commerce Domain
  14. Intelligent Agents with LLM-based Process Automation
  15. Parrot: Enhancing Multi-Turn Instruction Following for Large Language Models
  16. Persuading across Diverse Domains: a Dataset and Persuasion Large Language Model
  17. See or Guess: Counterfactually Regularized Image Captioning
  18. TiVA: Time-Aligned Video-to-Audio Generation
  19. Understanding Human Preferences: Towards More Personalized Video to Text Generation
  20. What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?