PPaperPicks

Xiaokang Yang

Shanghai Jiao Tong University, Shanghai, China

77 papers at tracked venues · 64 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. ChemReason-Bench: Benchmarking Large Language Models for Procedural Reasoning in Experimental Chemistry
  2. GeoLayer: Towards Low-Latency and Cost-Efficient Geo-Distributed Graph Stores with Layered Graph
  3. Latent Knowledge-Guided Video Diffusion for Scientific Phenomena Generation from a Single Initial Frame
  4. MetaTrader: Learning to Generalize RL Trading Policies Beyond Offline Data
  5. A Token-Level Text Image Foundation Model for Document Understanding
  6. ARB-LLM: Alternating Refined Binarizations for Large Language Models
  7. AniSDF: Fused-Granularity Neural Surfaces with Anisotropic Encoding for High-Fidelity 3D Reconstruction
  8. Baking Gaussian Splatting Into Diffusion Denoiser for Fast and Scalable Single-Stage Image-to-3D Generation and Reconstruction
  9. ChemActor: Enhancing Automated Extraction of Chemical Synthesis Actions with LLM-Generated Data
  10. Continual Visual Reinforcement Learning with A Life-Long World Model
  11. DAWP: A framework for global observation forecasting via Data Assimilation and Weather Prediction in satellite observation space
  12. Disentangled Clothed Avatar Generation with Layered Representation
  13. Disentangled World Models: Learning to Transfer Semantic Knowledge from Distracting Videos for Reinforcement Learning
  14. Domain Generalization in CLIP via Learning with Diverse Text Prompts
  15. Domain Prompt Learning with Quaternion Networks (Extended Abstract)
  16. EndoDAV: Depth Any Video in Endoscopy with Spatiotemporal Accuracy
  17. EvoMesh: Adaptive Physical Simulation with Hierarchical Graph Evolutions
  18. FATE: Feature-Adapted Parameter Tuning for Vision-Language Models
  19. Generalized Tensor-Based Parameter-Efficient Fine-Tuning via Lie Group Transformations
  20. HAODiff: Human-Aware One-Step Diffusion via Dual-Prompt Guidance
  21. Human Body Restoration with One-Step Diffusion Model and A New Benchmark
  22. HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
  23. KinFormer: Generalizable Dynamical Symbolic Regression for Catalytic Organic Reaction Kinetics
  24. MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding
  25. Maintaining Structural Integrity in Parameter Spaces for Parameter Efficient Fine-tuning
  26. Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
  27. Multimodal Latent Diffusion Model for Complex Sewing Pattern Generation
  28. OPMapper: Enhancing Open-Vocabulary Semantic Segmentation with Multi-Guidance Information
  29. OSDFace: One-Step Diffusion Model for Face Restoration
  30. OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions
  31. Open-World Reinforcement Learning over Long Short-Term Imagination
  32. POMP: Physics-constrainable Motion Generative Model through Phase Manifolds
  33. PassionSR: Post-Training Quantization with Adaptive Scale in One-Step Diffusion based Image Super-Resolution
  34. Perceiving and Acting in First-Person: A Dataset and Benchmark for Egocentric Human-Object-Human Interactions
  35. PostCast: Generalizable Postprocessing for Precipitation Nowcasting via Unsupervised Blurriness Modeling
  36. PostEdit: Posterior Sampling for Efficient Zero-Shot Image Editing
  37. QuantCache: Adaptive Importance-Guided Quantization with Hierarchical Latent and Layer Caching for Video Generation
  38. Rethinking Classifier Re-Training in Long-Tailed Recognition: Label Over-Smooth Can Balance
  39. S3-Face: SSS-Compliant Facial Reflectance Estimation via Diffusion Priors
  40. Star with Bilinear Mapping
  41. Unleashing the Power of One-Step Diffusion based Image Super-Resolution via a Large-Scale Diffusion Discriminator
  42. Unleashing the Power of Task-Specific Directions in Parameter Efficient Fine-tuning
  43. Video-Enhanced Offline Reinforcement Learning: A Model-Based Approach
  44. Boundary Matters: A Bi-Level Active Finetuning Method
  45. Bridging Synthetic and Real Worlds for Pre-Training Scene Text Detectors
  46. CasCast: Skillful High-resolution Precipitation Nowcasting via Cascaded Modelling
  47. Domain Prompt Learning with Quaternion Networks
  48. Domain-Controlled Prompt Learning
  49. DynaVol: Unsupervised Learning for Dynamic Scenes through Object-Centric Voxelization
  50. E3Gen: Efficient, Expressive and Editable Avatars Generation
  51. EndoGSLAM: Real-Time Dense Reconstruction and Tracking in Endoscopic Surgeries Using Gaussian Splatting
  52. HDR-GS: Efficient High Dynamic Range Novel View Synthesis at 1000x Speed via Gaussian Splatting
  53. HIMO: A New Benchmark for Full-Body Human Interacting with Multiple Objects
  54. Infusion: Preventing Customized Text-to-Image Diffusion from Overfitting
  55. Inter-X: Towards Versatile Human-Human Interaction Analysis
  56. LERE: Learning-Based Low-Rank Matrix Recovery with Rank Estimation
  57. Latent Intuitive Physics: Learning to Transfer Hidden Physics from A 3D Video
  58. Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
  59. Missing as Masking: Arbitrary Cross-Modal Feature Reconstruction for Incomplete Multimodal Brain Tumor Segmentation
  60. Model-Based Reinforcement Learning with Multi-task Offline Pretraining
  61. Monocular Identity-Conditioned Facial Reflectance Reconstruction
  62. Multi-times Monte Carlo Rendering for Inter-reflection Reconstruction
  63. NTIRE 2024 Challenge on Image Super-Resolution (×4): Methods and Results
  64. NeuMA: Neural Material Adaptor for Visual Grounding of Intrinsic Dynamics
  65. Partial Label Learning with a Partner
  66. PosFormer: Recognizing Complex Handwritten Mathematical Expression with Position Forest Transformer
  67. Radiative Gaussian Splatting for Efficient X-Ray Novel View Synthesis
  68. ReGenNet: Towards Human Action-Reaction Synthesis
  69. ReLIZO: Sample Reusable Linear Interpolation-based Zeroth-order Optimization
  70. Recursive Generalization Transformer for Image Super-Resolution
  71. SAM-PARSER: Fine-Tuning SAM Efficiently by Parameter Space Reconstruction
  72. SaccadeDet: A Novel Dual-Stage Architecture for Rapid and Accurate Detection in Gigapixel Images
  73. SaccadeMOT: Enhancing Object Detection and Tracking in Gigapixel Images via Scale-Aware Density Estimation
  74. SparseFormer: Detecting Objects in HRW Shots via Sparse Vision Transformer
  75. Tendency-Driven Mutual Exclusivity for Weakly Supervised Incremental Semantic Segmentation
  76. VidToMe: Video Token Merging for Zero-Shot Video Editing
  77. Xformer: Hybrid X-Shaped Transformer for Image Denoising