|
* equal contribution; † equal advising.
|
Junli Wang*, Zhoujun Cheng*†, Yuxuan Zhang*, Shibo Hao, Yao Tang, Zhiting Hu, Prithviraj Ammanabrolu, Hao Zhang† Technical Blog and Repo blog | code | model | data TL;DR: Scaling parallel environments for digital agents (coding & computer-use) for large-scale agent RL and distillation. |
|
Zhoujun Cheng*, Yutao Xie*, Yuxiao Qu*, Amrith Setlur*, Shibo Hao, Varad Pimpalkhute, Tongtong Liang, Feng Yao, Zhengzhong Liu, Eric Xing, Virginia Smith, Ruslan Salakhutdinov, Zhiting Hu, Taylor Killian, Aviral Kumar ICML 2026 pdf | website | slides @Northwestern MLL Lab TL;DR: Given a fixed sampling compute budget C, how should it be allocated across problems per batch Bproblem, rollouts per problem n, and sequential training steps M ? |
|
Cocoa Team Under Review pdf | website | code TL;DR: A unified agent benchmark that requires coding, computer use, and deep research. |
|
Zhoujun Cheng*, Shibo Hao*, Tianyang Liu*, Fan Zhou, Yutao Xie, Feng Yao, Yuexin Bian, Yonghao Zhuang, Eric P. Xing, Zhiting Hu NeurIPS 2025 Datasets & Benchmarks pdf | website | dataset | code | model TL;DR: A study of RL for LLM general reasoning with 92K curated problems across six domains. |
|
Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat Preprint TL;DR: A unified LM family bridging autoregressive and masked diffusion paradigms. |
|
Fan Zhou*, Zengzhi Wang*, Nikhil Ranjan, Zhoujun Cheng, Liping Tang, Guowei He, Zhengzhong Liu, Eric P. Xing COLM 2025 pdf | dataset | code TL;DR: A 200B-scale high-quality mathematical mid-training dataset. |
|
Core contributor (responsible for pretraining scaling law and post-training for reasoning) Technical Report pdf | data | code TL;DR: A fully open 70B reasoning-enhanced LLM pretrained from scratch. |
|
Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, Ruisheng Cao, Toh Jing Hua, Zhoujun Cheng, Dongchan Shin, Fangyu Lei, Yitao Liu, Yiheng Xu, Shuyan Zhou, Silvio Savarese, Caiming Xiong, Victor Zhong, Tao Yu NeurIPS 2024 Datasets & Benchmarks pdf | website | code | data | data viewer TL;DR: A computer use agent benchmark. |
|
Terry Yue Zhuo, Minh Chien Vu, Jenny Chim, Han Hu, Wenhao Yu, Ratnadira Widyasari, Imam Nur Bani Yusuf, Haolan Zhan, Junda He, Indraneil Paul, Simon Brunner, Chen Gong, Thong Hoang, Armel Randy Zebaze, Xiaoheng Hong, Wen-Ding Li, Jean Kaddour, Ming Xu, Zhihan Zhang, Prateek Yadav, Naman Jain, Alex Gu, Zhoujun Cheng, Jiawei Liu, Qian Liu, Zijian Wang, Binyuan Hui, Niklas Muennighoff, David Lo, Daniel Fried, Xiaoning Du, Harm de Vries, Leandro Von Werra ICLR 2025 (Oral) pdf | website | code TL;DR: A benchmark for code generation with diverse function calls and complex instructions. |
|
Tianbao Xie*, Fan Zhou*, Zhoujun Cheng*, Peng Shi*, Luoxuan Weng*, Yitao Liu*, Toh Jing Hua, Junning Zhao, Qian Liu, Che Liu, Leo Z. Liu, Yiheng Xu, Hongjin Su, Dongchan Shin, Caiming Xiong, Tao Yu COLM 2024, 4.7k github stars, 7k demo users pdf | code | demo | docs TL;DR: An open platform for using, hosting, and building language agents. |
|
Zhiruo Wang, Zhoujun Cheng, Hao Zhu, Daniel Fried, Graham Neubig COLM 2024 pdf | collection TL;DR: An attempt to clarify and discuss some ambiguities in LM tool-using papers. |
|
Yiheng Xu*, Hongjin Su*, Chen Xing*, Boyu Mi, Qian Liu, Weijia Shi, Binyuan Hui, Fan Zhou, Yitao Liu, Tianbao Xie, Zhoujun Cheng, Siheng Zhao, Lingpeng Kong, Bailin Wang, Caiming Xiong, Tao Yu ICLR 2024 (Spotlight) pdf | code | checkpoint TL;DR: A pretrained 70B agent model with balanced code-text corpora. |
|
Zhoujun Cheng, Jungo Kasai, Tao Yu EMNLP 2023 Industry Track pdf | code TL;DR: Batch multiple queries into a single prompt for cheaper, faster LLM API inference. |
|
Zhoujun Cheng*, Tianbao Xie*, Peng Shi, Chengzu Li, Rahul Nadkarni, Yushi Hu, Caiming Xiong, Dragomir Radev, Mari Ostendorf, Luke Zettlemoyer, Noah A. Smith, Tao Yu ICLR 2023 (Spotlight) pdf | code | demo TL;DR: A training-free neural-symbolic framework mapping task inputs to programs of LLM calls + symbolic languages. |
|
Zhoujun Cheng*, Haoyu Dong*, Zhiruo Wang*, Ran Jia, Jiaqi Guo, Yan Gao, Shi Han, Jian-Guang Lou, Dongmei Zhang ACL 2022 pdf | code | dataset TL;DR: A hierarchical table dataset for question answering and natural language generation. |
|
Zhoujun Cheng*, Haoyu Dong*, Ran Jia, Pengfei Wu, Shi Han, Fan Cheng, Dongmei Zhang ACL 2022 pdf | code TL;DR: Adopting spreadsheet formulas to enhance numerical reasoning skills of table modeling. |
|
Fan Zhou, Mengkang Hu, Haoyu Dong, Zhoujun Cheng, Shi Han, Dongmei Zhang EMNLP 2022 Findings TL;DR: Pre-computing data cubes for numerical reasoning over tables. |
|
|
|
|