P
PaperPicks
Conferences
Luca Soldaini
Amazon Alexa, CA, USA
24 papers at tracked venues · 18 at CORE A* · active 2024–2026
DBLP profile ↗
ORCID 0000-0001-6998-9863 ↗
Google Scholar ↗
Homepage ↗
Venues
ACL
×6
NeurIPS
×4
ICLR
×3
EMNLP
×2
ICML
×2
NAACL
×2
AAAI
×1
CVPR
×1
ECIR
×1
SIGIR
×1
WSDM
×1
Frequent coauthors
Ian Magnusson
DBLP profile ↗
ORCID search ↗
×2
Orion Weller
DBLP profile ↗
ORCID search ↗
×2
Li Lucy
DBLP profile ↗
ORCID search ↗
×2
Jake Poznanski
DBLP profile ↗
ORCID search ↗
×1
Dawn J. Lawrie
DBLP profile ↗
ORCID search ↗
×1
Sami Baral
DBLP profile ↗
ORCID search ↗
×1
Weijia Shi
DBLP profile ↗
ORCID search ↗
×1
Samir Yitzhak Gadre
DBLP profile ↗
ORCID search ↗
×1
Matt Deitke
DBLP profile ↗
ORCID search ↗
×1
Niklas Muennighoff
DBLP profile ↗
ORCID search ↗
×1
Jiacheng Liu
DBLP profile ↗
ORCID search ↗
×1
Alexander Wettig
DBLP profile ↗
ORCID search ↗
×1
Papers
The olmOCR Project: Building Fully Open OCR using VLMs
ACL 2026
·
Jake Poznanski
DBLP profile ↗
ORCID search ↗
WSDM CUP 2026: Multilingual Retrieval
WSDM 2026
·
Dawn J. Lawrie
DBLP profile ↗
ORCID search ↗
DataDecide: How to Predict Best Pretraining Data with Small Experiments
ICML 2025
·
Ian Magnusson
DBLP profile ↗
ORCID search ↗
DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images
NAACL 2025
·
Sami Baral
DBLP profile ↗
ORCID search ↗
FlexOLMo: Open Language Models for Flexible Data Use
NeurIPS 2025
·
Weijia Shi
DBLP profile ↗
ORCID search ↗
FollowIR: Evaluating and Teaching Information Retrieval Models to Follow Instructions
NAACL 2025
·
Orion Weller
DBLP profile ↗
ORCID search ↗
Language models scale reliably with over-training and on downstream tasks
ICLR 2025
·
Samir Yitzhak Gadre
DBLP profile ↗
ORCID search ↗
Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
CVPR 2025
·
Matt Deitke
DBLP profile ↗
ORCID search ↗
OLMoE: Open Mixture-of-Experts Language Models
ICLR 2025
·
Niklas Muennighoff
DBLP profile ↗
ORCID search ↗
OLMoTrace: Tracing Language Model Outputs Back to Trillions of Training Tokens
ACL 2025
·
Jiacheng Liu
DBLP profile ↗
ORCID search ↗
Organize the Web: Constructing Domains Enhances Pre-Training Data Curation
ICML 2025
·
Alexander Wettig
DBLP profile ↗
ORCID search ↗
RouterRetriever: Routing over a Mixture of Expert Embedding Models
AAAI 2025
·
Hyunji Lee
DBLP profile ↗
ORCID search ↗
SciRIFF: A Resource to Enhance Language Model Instruction-Following over Scientific Literature
EMNLP 2025
·
David Wadden
DBLP profile ↗
ORCID search ↗
The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text
NeurIPS 2025
·
Nikhil Kandpal
DBLP profile ↗
ORCID search ↗
mFollowIR: A Multilingual Benchmark for Instruction Following in Retrieval
ECIR 2025
·
Orion Weller
DBLP profile ↗
ORCID search ↗
AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data Filters
ACL 2024
·
Li Lucy
DBLP profile ↗
ORCID search ↗
DataComp-LM: In search of the next generation of training sets for language models
NeurIPS 2024
·
Jeffrey Li
DBLP profile ↗
ORCID search ↗
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
ACL 2024
·
Luca Soldaini
KIWI: A Dataset of Knowledge-Intensive Writing Instructions for Answering Research Questions
ACL 2024
·
Fangyuan Xu
DBLP profile ↗
ORCID search ↗
MathFish: Evaluating Language Model Math Reasoning via Grounding in Educational Curricula
EMNLP 2024
·
Li Lucy
DBLP profile ↗
ORCID search ↗
OLMo: Accelerating the Science of Language Models
ACL 2024
·
Dirk Groeneveld
DBLP profile ↗
ORCID search ↗
On the Evaluation of Machine-Generated Reports
SIGIR 2024
·
James Mayfield
DBLP profile ↗
ORCID search ↗
Paloma: A Benchmark for Evaluating Language Model Fit
NeurIPS 2024
·
Ian Magnusson
DBLP profile ↗
ORCID search ↗
What's In My Big Data?
ICLR 2024
·
Yanai Elazar
DBLP profile ↗
ORCID search ↗