PPaperPicks

Jie Tang

Tsinghua University, Department of Computer Science and Technology, Beijing, China

88 papers at tracked venues · 79 at CORE A* · active 20242026

Venues

Frequent coauthors

Papers

  1. Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation
  2. Data Efficient RLVR via Off-Policy Influence Guidance
  3. DataSciBench: An LLM Agent Benchmark for Data Science
  4. DiKGRec: Generative Recommender Model with Diffusion and Knowledge Graph-Based Reasoning
  5. Glyph: Scaling Context Windows via Visual-Text Compression
  6. HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
  7. Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement
  8. KARL: Reinforcement Learning for LLM Agents on Multi-Turn Knowledge-Intensive Agentic Tasks
  9. MTP-RL: Acceleration of Reinforcement Learning Rollouts with Policy-Aligned Multi-Token Prediction
  10. MathSE: Improving Multimodal Mathematical Reasoning via Self-Evolving Iterative Reflection and Reward-Guided Fine-Tuning
  11. PlotGen-Bench: Evaluating VLMs on Generating Visualization Code from Diverse Plots across Multiple Libraries
  12. RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
  13. SCAIR: Schema-Conditioned Agentic Iterative Reasoning for Enterprise Knowledge Graphs
  14. UDA: Unsupervised Debiasing Alignment for Pair-wise LLM-as-a-Judge
  15. VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation
  16. A Stronger Mixture of Low-Rank Experts for Fine-Tuning Foundation Models
  17. A Survey of Post-Training Scaling in Large Language Models
  18. AndroidGen: Building an Android Language Agent under Data Scarcity
  19. AndroidLab: Training and Systematic Benchmarking of Android Autonomous Agents
  20. Can Large Language Models Master Complex Card Games?
  21. CoT-based Synthesizer: Enhancing LLM Performance through Answer Synthesis
  22. CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning
  23. CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
  24. Dynamic Scaling of Unit Tests for Code Reward Modeling
  25. GuARD: Effective Anomaly Detection through a Text-Rich and Graph-Informed Language Model
  26. HPSS: Heuristic Prompting Strategy Search for LLM Evaluators
  27. LVBench: An Extreme Long Video Understanding Benchmark
  28. LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
  29. LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
  30. LongSafety: Evaluating Long-Context Safety of Large Language Models
  31. LongWriter: Unleashing 10, 000+ Word Generation from Long Context LLMs
  32. MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
  33. SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
  34. SWE-Dev: Building Software Engineering Agents with Training and Inference Scaling
  35. Scaling Speech-Text Pre-training with Synthetic Interleaved Data
  36. Small Language Model Makes an Effective Long Text Extractor
  37. SoAy: A Solution-based LLM API-using Methodology for Academic Information Seeking
  38. T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
  39. TableLLM: Enabling Tabular Data Manipulation by LLMs in Real Office Usage Scenarios
  40. TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
  41. Understanding the Stability-based Generalization of Personalized Federated Learning
  42. VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
  43. VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
  44. WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning
  45. ZeroFlow: Overcoming Catastrophic Forgetting is Easier than You Think
  46. AgentBench: Evaluating LLMs as Agents
  47. AgentTuning: Enabling Generalized Agent Abilities for LLMs
  48. AlignBench: Benchmarking Chinese Alignment of Large Language Models
  49. AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Models
  50. AutoRE: Document-Level Relation Extraction with Large Language Models
  51. AutoWebGLM: A Large Language Model-based Web Navigating Agent
  52. BOND: Bootstrapping From-Scratch Name Disambiguation with Multi-task Promoting
  53. Benchmarking Complex Instruction-Following with Multiple Constraints Composition
  54. Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
  55. Challenges Toward AGI and Its Impact to the Web
  56. CharacterGLM: Customizing Social Characters with Large Language Models
  57. ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipeline
  58. CogAgent: A Visual Language Model for GUI Agents
  59. CogVLM: Visual Expert for Pretrained Language Models
  60. CogView3: Finer and Faster Text-to-Image Generation via Relay Diffusion
  61. CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
  62. Generative AI Day
    SIGKDD 2024 · Jie Tang
  63. Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
  64. KoLA: Carefully Benchmarking World Knowledge of Large Language Models
  65. LongAlign: A Recipe for Long Context Alignment of Large Language Models
  66. LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
  67. LongRAG: A Dual-Perspective Retrieval-Augmented Generation Paradigm for Long-Context Question Answering
  68. MSAGPT: Neural Prompting Protein Structure Prediction via MSA Generative Pre-Training
  69. Middleware for LLMs: Tools Are Instrumental for Language Agents in Complex Environments
  70. NaturalCodeBench: Examining Coding Performance Mismatch on HumanEval and Natural User Queries
  71. OAG-Bench: A Human-Curated Benchmark for Academic Graph Mining
  72. OpenWebAgent: An Open Toolkit to Enable Web Agents on Large Language Models
  73. Pre-Training and Prompting for Few-Shot Node Classification on Text-Attributed Graphs
  74. ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search
  75. RecDCL: Dual Contrastive Learning for Recommendation
  76. Relay Diffusion: Unifying diffusion process across resolutions for image synthesis
  77. Revisiting Parallel Context Windows: A Frustratingly Simple Alternative and Chain-of-Thought Deterioration
  78. SafetyBench: Evaluating the Safety of Large Language Models
  79. SciInstruct: a Self-Reflective Instruction Annotated Dataset for Training Scientific Language Models
  80. SpreadsheetBench: Towards Challenging Real World Spreadsheet Manipulation
  81. The First Workshop on AI Behavioral Science
  82. The Second Workshop on Large Language Models for Individuals, Groups, and Society
  83. Towards Efficient Exact Optimization of Language Model Alignment
  84. Training Compute-Optimal Protein Language Models
  85. Transferable and Efficient Non-Factual Content Detection via Probe Training with Offline Consistency Checking
  86. TriSampler: A Better Negative Sampling Principle for Dense Retrieval
  87. Understanding Emergent Abilities of Language Models from the Loss Perspective
  88. WSDM 2024 Workshop on Large Language Models for Individuals, Groups, and Society