PPaperPicks

Jie Zhou

Tsinghua University, Department of Automation, Tsinghua National Laboratory for Information Science and Technology, Beijing, China

53 papers at tracked venues · 44 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision
  2. More Than Sum of Its Parts: Deciphering Intent Shifts in Multimodal Hate Speech Detection
  3. PianoBand: A Multimodal Wristband Interface for Portable Piano Interaction
  4. WristPP: A Wrist-Worn System for Hand Pose and Pressure Estimation
  5. 3D Touch Force Estimation from Capacitive Images
  6. Authentic 4D Driving Simulation with a Video Generation Model
  7. D3QE: Learning Discrete Distribution Discrepancy-Aware Quantization Error for Autoregressive-Generated Image Detection
  8. EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients
  9. EfficientLLaVA: Generalizable Auto-Pruning for Large Vision-language Models
  10. EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-Based Online Scene Understanding
  11. EmbodiedSAM: Online Segment Any 3D Thing in Real Time
  12. Entropy-Adaptive Diffusion Policy Optimization with Dynamic Step Alignment
  13. FADE: Frequency-Aware Diffusion Model Factorization for Video Editing
  14. FineType: Fine-grained Tapping Gesture Recognition for Text Entry
  15. FingerGlass: Enhancing Smart Glasses Interaction via Fingerprint Sensing
  16. GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
  17. IGL-Nav: Incremental 3D Gaussian Localization for Image-Goal Navigation
  18. InstaRevive: One-Step Image Enhancement via Dynamic Score Matching
  19. Learning Counterfactually Decoupled Attention for Open-World Model Attribution
  20. LiCamPose: Combining Multi-View LiDAR and RGB Cameras for Robust Single-timestamp 3D Human Pose Estimation
  21. Point3R: Streaming 3D Reconstruction with Explicit Spatial Pointer Memory
  22. ReverB-SNN: Reversing Bit of the Weight and Activation for Spiking Neural Networks
  23. SpectralAR: Spectral Autoregressive Visual Generation
  24. Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding
  25. UniGoal: Towards Universal Zero-shot Goal-oriented Navigation
  26. UniPre3D: Unified Pre-training of 3D Point Cloud Models with Cross-Modal Gaussian Splatting
  27. Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
  28. Camera-LiDAR Cross-Modality Gait Recognition
  29. DC-Solver: Improving Predictor-Corrector Diffusion Sampler via Dynamic Compensation
  30. DPMesh: Exploiting Diffusion Prior for Occluded Human Mesh Recovery
  31. DSPDet3D: 3D Small Object Detection with Dynamic Spatial Pruning
  32. Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
  33. FlowIE: Efficient Image Enhancement via Rectified Flow
  34. FlowTurbo: Towards Real-time Flow-Based Image Generation with Velocity Refiner
  35. GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction
  36. Learning 1D Causal Visual Representation with De-focus Attention Networks
  37. Learning Dual-Level Deformable Implicit Representation for Real-World Scale Arbitrary Super-Resolution
  38. Learning Multi-Scale Video-Text Correspondence for Weakly Supervised Temporal Article Gronding
  39. LiDAR-Based Person Re-Identification
  40. LowRankOcc: Tensor Decomposition and Low-Rank Recovery for Vision-Based 3D Semantic Occupancy Prediction
  41. Memory-based Adapters for Online 3D Scene Perception
  42. NTIRE 2024 Challenge on Short-form UGC Video Quality Assessment: Methods and Results
  43. NTIRE 2024 Quality Assessment of AI-Generated Content Challenge
  44. NeuroGauss4D-PCI: 4D Neural Fields and Gaussian Deformation Fields for Point Cloud Interpolation
  45. Path Choice Matters for Clear Attributions in Path Methods
  46. ProtoComp: Diverse Point Cloud Completion with Controllable Prototype
  47. Q-VLM: Post-training Quantization for Large Vision-Language Models
  48. SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation
  49. SelfOcc: Self-Supervised Vision-Based 3D Occupancy Prediction
  50. SpatialFormer: Towards Generalizable Vision Transformers with Explicit Spatial Understanding
  51. Towards Accurate Post-Training Quantization for Diffusion Models
  52. Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
  53. XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation