PPaperPicks

Jiaya Jia

33 papers at tracked venues · 27 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation
  2. TRAC: Teacher-Guided Token Reward with Adaptive Calibration for Robust Policy Optimization
  3. TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning
  4. DLoFT: Gradient-Decoupled Fine-Tuning for Generalizable Long Chain-of-Thought Reasoning
  5. Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
  6. DreamOmni: Unified Image Generation and Editing
  7. Enhancing LLM Knowledge Learning through Generalization
  8. GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning
  9. Generative Video Propagation
  10. LYRA: An Efficient and Speech-Centric Framework for Omni-Cognition
  11. Logits-Based Finetuning
  12. MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation
  13. MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
  14. Mixture-of-Scores: Robust Image-Text Data Valuation via Three Lines of Code
  15. TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
  16. Training-Free Efficient Video Generation via Dynamic Token Carving
  17. VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
  18. VisionZip: Longer is Better but Not Necessary in Vision Language Models
  19. GroupContrast: Semantic-Aware Self-Supervised Representation Learning for 3D Understanding
  20. LISA: Reasoning Segmentation via Large Language Model
  21. LLMGA: Multimodal Large Language Model Based Generation Assistant
  22. LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models
  23. LogoSticker: Inserting Logos Into Diffusion Models for Customized Generation
  24. LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models
  25. MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs
  26. Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models
  27. OA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic Segmentation
  28. Prompt Highlighter: Interactive Control for Multi-Modal LLMs
  29. RL-GPT: Integrating Reinforcement Learning and Code-as-policy
  30. SaCo Loss: Sample-Wise Affinity Consistency for Vision-Language Pre-Training
  31. Scalable Language Model with Generalized Continual Learning
  32. Unified Language-Driven Zero-Shot Domain Adaptation
  33. Video-P2P: Video Editing with Cross-Attention Control