Shiping Gao

I am a PhD student in Computer Science and Engineering at the University of Michigan, advised by Prof. Silviu Pitis. My research interests include natural language processing, large language models, RLHF, reward hacking, fine-grained reward modeling, and LLM reasoning.

Before joining UMich, I completed an MPhil in Computer Science and Technology at Sun Yat-Sen University, advised by Prof. Xiaojun Quan, and a BEng in Computer Science and Technology at Lanzhou University.

Research Focus

My work studies how language models learn from preferences and feedback, with an emphasis on reward modeling, policy optimization, and reasoning. Recent projects include prefix-value learning for distribution-level optimization, token-level reward models, advantage-guided distillation for preference alignment, and edit-wise preference optimization for grammatical error correction.

Education

  • University of Michigan, PhD in Computer Science and Engineering, Sep 2026 - Jun 2030 (Expected)
  • Sun Yat-Sen University, MPhil in Computer Science and Technology, Sep 2023 - Jun 2026
  • Lanzhou University, BEng in Computer Science and Technology, Sep 2019 - Jul 2023

Publications

Also on Google Scholar. Click a title for details and BibTeX.

Adaptive Boundaries: Context-Aware Detection for Synthetic Text
H. Li, R. Ni, Haihui Yang, Shiping Gao, Y. Liu, Xiaojun Quan
The 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026), 2026
Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization
Shiping Gao, Hongzhan Chen, Xiaojun Quan, Qifan Wang, Lifu Huang
43rd International Conference on Machine Learning (ICML 2026), 2026
Stabilizing Policy Optimization via Logits Convexity
Hongzhan Chen, Tao Yang, Yuhua Zhu, Shiping Gao, Xiaojun Quan, Ting Yao
arXiv preprint arXiv:2603.00963, 2026 Under review at NeurIPS 2026
Discriminative Policy Optimization for Token-Level Reward Models
Hongzhan Chen, Tao Yang, Shiping Gao, Ruijun Chen, Xiaojun Quan, Hongtao Tian, Ting Yao
42nd International Conference on Machine Learning (ICML 2025), 2025
Advantage-Guided Distillation for Preference Alignment in Small Language Models
Shiping Gao, Fanqi Wan, Jiajian Guo, Xiaojun Quan, Qifan Wang
13th International Conference on Learning Representations (ICLR 2025), 2025 Spotlight, top 5.1%
Edit-Wise Preference Optimization for Grammatical Error Correction
Jiehao Liang, Haihui Yang, Shiping Gao, Xiaojun Quan
31st International Conference on Computational Linguistics (COLING 2025), 2025
Self-Evolution Fine-Tuning for Policy Optimization
Ruijun Chen, Jiehao Liang, Shiping Gao, Fanqi Wan, Xiaojun Quan
Findings of the Association for Computational Linguistics: EMNLP 2024, 2024
A Novel Dynamic Interpolation Method Based on Temporal and Spatial Correlations
Shiping Gao, Dongjie He, Zhouzhuo Zhang, Xiaoqian Tang, Zhili Zhao
Applied Intelligence, 2022

Academic Service

  • Reviewer: NeurIPS 2026, EMNLP 2026
  • Teaching Assistant: Artificial Neural Networks and Mathematical Principles of Reinforcement Learning, Sun Yat-Sen University (2025)

CV

A PDF version of my CV is available here (updated Aug 2026). The web version is on the CV page.

Contact

I can be reached at shiping@umich.edu or rungao2001@outlook.com.