Research

My research centers on preference alignment, reward modeling, reinforcement learning from feedback, and reasoning in large language models.

Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization

Internship, University of California, Davis
Supervised by Prof. Lifu Huang
Jul 2025 - Jan 2026

Discriminative Policy Optimization for Token-Level Reward Models

Research Team Member, Sun Yat-Sen University
Supervised by Prof. Xiaojun Quan
Oct 2024 - Jan 2025

Advantage-Guided Distillation for Preference Alignment in Small Language Models

Principal Investigator, Sun Yat-Sen University
Supervised by Prof. Xiaojun Quan
Jul 2024 - Oct 2024

Edit-Wise Preference Optimization for Grammatical Error Correction

Research Team Member, Sun Yat-Sen University
Supervised by Prof. Xiaojun Quan
Jul 2024 - Sep 2024

Chinese Text Correction System Based on Deep Learning

Outstanding Undergraduate Thesis, Lanzhou University
Supervised by Prof. Binbin Yong
Dec 2022 - May 2023

A Novel Dynamic Interpolation Method Based on Temporal and Spatial Correlations

Research Team Member, Lanzhou University
Supervised by Prof. Zhili Zhao
May 2021 - Oct 2021