PPaperPicks

Xiaojun Wan

Peking University, Institute of Computer Science and Technology, MOE Key Laboratory of Computational Linguistics, Beijing, China

44 papers at tracked venues · 28 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria
  2. DecoCal: Decoding with Calibration in Diffusion Large Language Models
  3. Edit-Aware Reward Modeling for Chinese Grammatical Error Correction
  4. From TDMA to CDMA: A Multi-bit Watermark for Diffusion Language Models
  5. Ghost in the Shell: Synonym-Aware Logit Shaping Fingerprint for Copyright Protection of Large Vision-Language Models
  6. HAD: HAllucination Detection Language Models Based on a Comprehensive Hallucination Taxonomy
  7. JointCQ: Improving Factual Hallucination Detection with Joint Claim and Query Generation
  8. LEDOM: Reverse Language Model
  9. Minos: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
  10. QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs
  11. RST-Guarder: Enhancing Long-Context Robustness for Safeguards via RST Parsing and Probabilistic Inference
  12. SCOPE: Intrinsic Semantic Space Control for Mitigating Copyright Infringement in LLMs
  13. UMMF: Protecting Copyright of Large Vision-Language Models through Unlearning-based Multimodal Memorization Fingerprint
  14. A Dual-Perspective NLG Meta-Evaluation Framework with Automatic Benchmark and Better Interpretability
  15. Analyzing and Evaluating Correlation Measures in NLG Meta-Evaluation
  16. B⁴: A Black-Box Scrubbing Attack on LLM Watermarks
  17. C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation
  18. DAMON: A Dialogue-Aware MCTS Framework for Jailbreaking Large Language Models
  19. DSGram: Dynamic Weighting Sub-Metrics for Grammatical Error Correction in the Era of Large Language Models
  20. Enhancing LLM Watermark Resilience Against Both Scrubbing and Spoofing Attacks
  21. Evaluating Self-Generated Documents for Enhancing Retrieval-Augmented Generation with Large Language Models
  22. Exploring Causal Effect of Social Bias on Faithfulness Hallucinations in Large Language Models
  23. Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
  24. Gödel Agent: A Self-Referential Agent Framework for Recursively Self-Improvement
  25. ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMs
  26. MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
  27. R-Bind: Unified Enhancement of Attribute and Relation Binding in Text-to-Image Diffusion Models
  28. Re-evaluating Automatic LLM System Ranking for Alignment with Human Preference
  29. Towards A "Novel" Benchmark: Evaluating Literary Fiction with Large Language Models
  30. Tracing Training Footprints: A Calibration Approach for Membership Inference Attacks Against Multimodal Large Language Models
  31. TriEmbed: Bridge the Gap between Text and Token Indices with Embedding Reparameterization
  32. WaterPool: A Language Model Watermark Mitigating Trade-Offs among Imperceptibility, Efficacy and Robustness
  33. Where Do LLMs Go Wrong? Diagnosing Automated Peer Review via Aspect-Guided Multi-Level Perturbation
  34. Who Writes What: Unveiling the Impact of Author Roles on AI-generated Text Detection
  35. Are LLM-based Evaluators Confusing NLG Quality Criteria?
  36. Benchmarking Knowledge Boundary for Large Language Models: A Different Perspective on Model Evaluation
  37. Better than Random: Reliable NLG Human Evaluation with Constrained Active Sampling
  38. Defining and Detecting Vulnerability in Human Evaluation Guidelines: A Preliminary Study Towards Reliable NLG Evaluation
  39. Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency
  40. History Matters: Temporal Knowledge Editing in Large Language Model
  41. PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
  42. Selecting Large Language Model to Fine-tune via Rectified Scaling Law
  43. Style-Compress: An LLM-Based Prompt Compression Framework Considering Task-Specific Styles
  44. Themis: A Reference-free NLG Evaluation Language Model with Flexibility and Interpretability