PPaperPicks

Tae-Hyun Oh

26 papers at tracked venues · 17 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Beyond the Highlights: Video Retrieval with Salient and Surrounding Contexts
  2. Patch-wise Retrieval: A Bag of Practical Techniques for Instance-level Matching
  3. SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter
  4. mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval
  5. AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models
  6. AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
  7. Automated Model Discovery via Multi-modal & Multi-step Pipeline
  8. DisCoRD: Discrete Tokens to Continuous Motion via Rectified Flow Decoding
  9. Dr. Splat: Directly Referring 3D Gaussian Splatting via Direct Language Embedding Registration
  10. JointDiT: Enhancing RGB-Depth Joint Modeling with Diffusion Transformers
  11. Perceptually Accurate 3D Talking Head Generation: New Definitions, Speech-Mesh Representation, and Evaluation Metrics
  12. Robust 3D Shape Reconstruction in Zero-Shot from a Single Image in the Wild
  13. SoundBrush: Sound as a Brush for Visual Scene Editing
  14. VSC: Visual Search Compositional Text-to-Image Diffusion Model
  15. VoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language Models
  16. Zero-shot Depth Completion via Test-time Alignment with Affine-invariant Depth Prior
  17. BEAF: Observing BEfore-AFter Changes to Evaluate Hallucination in Vision-Language Models
  18. CAS: A Probability-Based Approach for Universal Condition Alignment Score
  19. Enhancing Speech-Driven 3D Facial Animation with Audio-Visual Guidance from Lip Reading Expert
  20. FPRF: Feed-Forward Photorealistic Style Transfer of Large-Scale 3D Neural Radiance Fields
  21. Learning-based Axial Video Motion Magnification
  22. MeTTA: Single-View to 3D Textured Mesh Reconstruction with Test-Time Adaptation
  23. MultiTalk: Enhancing 3D Talking Head Generation Across Languages with Multilingual Video Dataset
  24. Noise Map Guidance: Inversion with Spatial Context for Real Image Editing
  25. Paint-it: Text-to-Texture Synthesis via Deep Convolutional Texture Map Optimization and Physically-Based Rendering
  26. SMILE: Multimodal Dataset for Understanding Laughter in Video with Language Models