Google Scholar Citations

I am a Ph.D. student in Computer Science at Brigham Young University (BYU), co-advised by Prof. Taylor Killian and Prof. Amanda Hughes. I received my M.S. in Computer Science and Engineering from the University of Notre Dame, and my B.Eng. in Computer Science from Beijing Jiaotong University.

My research is in AI/ML, with a focus on Large Language Models (LLMs), Vision-Language and Multimodal Large Language Models (VLMs/MLLMs), computer vision, and trustworthy AI. I am particularly interested in post-training and reasoning distillation, test-time scaling, multimodal hallucination mitigation, and image forensics. I work day-to-day with PyTorch, Hugging Face Transformers, vLLM, DeepSpeed, and PEFT/LoRA, building reproducible distributed training and evaluation pipelines.

I am actively seeking research internships in LLMs, VLMs, multimodal reasoning, generative AI, and AI safety. I am always happy to connect and discuss related ideas.

🔥 News

  • 2026.02:  🎉 FRAME was accepted to the CVPR 2026 SAFE Workshop.
  • 2026.01:  🎉 ICPO was accepted to ICLR 2026.

📝 Publications

(* denotes equal contribution)

Image Forensics & Multimodal AI Safety

LLM Reasoning, Distillation & Test-Time Optimization

Trustworthy AI & Model Security

Federated Learning

📖 Educations

  • 2025.08 - 2028.05 (Expected), Ph.D. in Computer Science, Brigham Young University, Provo, USA
  • 2024.08 - 2025.08, M.S. in Computer Science and Engineering, University of Notre Dame, USA
  • 2020.09 - 2024.06, B.Eng. in Computer Science, Beijing Jiaotong University, Beijing, China

🛠 Skills

  • Programming & Systems: Python, C/C++, Bash, SQL, Git, Linux, CUDA, Docker, Slurm, LaTeX
  • ML/DL Frameworks: PyTorch, Hugging Face Transformers, JAX, TensorFlow, vLLM, DeepSpeed, Accelerate, PEFT/LoRA, FlashAttention, NumPy, Pandas, scikit-learn
  • LLMs & Post-Training: supervised fine-tuning, instruction tuning, reasoning distillation, chain-of-thought reasoning, test-time scaling, policy/preference optimization, model evaluation
  • VLMs, Vision & Multimodal AI: Vision-Language Models, Multimodal LLMs, computer vision, generative AI, image/audio-text modeling, image forensics, cross-modal consistency, hallucination mitigation
  • Research Engineering: distributed training, multi-GPU inference, model serving, retrieval-augmented generation, embeddings & vector search, reproducible evaluation pipelines, benchmark design, ablation studies