PPaperPicks

Bhiksha Raj

Carnegie Mellon University, Pittsburgh, USA

38 papers at tracked venues · 27 at CORE A* · active 20242025

Venues

Frequent coauthors

Papers

  1. ADIFF: Explaining audio difference using natural language
  2. Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
  3. CAARMA: Class Augmentation with Adversarial Mixup Regularization
  4. Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
  5. FALCON: Fairness Learning via Contrastive Attention Approach to Continual Semantic Scene Understanding
  6. ImageFolder: Autoregressive Image Generation with Folded Tokens
  7. Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Models
  8. Masked Autoencoders Are Effective Tokenizers for Diffusion Models
  9. Mellow: a small audio language model for reasoning
  10. On Fairness of Unified Multimodal Large Language Model for Image Generation
  11. On the Robust Approximation of ASR Metrics
  12. PhoniTale: Phonologically Grounded Mnemonic Generation for Typologically Distant Language Pairs
  13. SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions
  14. Scalable Benchmarking and Robust Learning for Noise-Free Ego-Motion and 3D Reconstruction from Noisy Video
  15. SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer
  16. Speech Robust Bench: A Robustness Benchmark For Speech Recognition
  17. Total-Editing: Head Avatar with Editable Appearance, Motion, and Lighting
  18. Toward Material-Agnostic System Identification From Videos
  19. Unsupervised Disentanglement of Content and Style via Variance-Invariance Constraints
  20. uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
  21. A General Framework for Learning from Weak Supervision
  22. AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition
  23. Completing Visual Objects via Bridging Generation and Segmentation
  24. Continual Contrastive Spoken Language Understanding
  25. DeWinder: Single-Channel Wind Noise Reduction using Ultrasound Sensing
  26. Domain Adaptation for Contrastive Audio-Language Models
  27. EAGLE: Efficient Adaptive Geometry-based Learning in Cross-view Understanding
  28. Imprecise Label Learning: A Unified Framework for Learning with Various Imprecise Label Configurations
  29. Metric from Human: Zero-shot Monocular Metric Depth Estimation via Test-time Adaptation
  30. PAM: Prompting Audio-Language Models for Audio Quality Assessment
  31. QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition
  32. R-BASS : Relevance-aided Block-wise Adaptation for Speech Summarization
  33. R2-Bench: Benchmarking the Robustness of Referring Perception Models Under Perturbations
  34. SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
  35. Slight Corruption in Pre-training Data Makes Better Diffusion Models
  36. Speech vs. Transcript: Does It Matter for Human Annotators in Speech Summarization?
  37. Synergistic Global-Space Camera and Human Reconstruction from Videos
  38. Understanding and Mitigating the Label Noise in Pre-training on Downstream Tasks