Publications

Journal Articles


IntentEval: Evaluating Whether Large Language Models Answer What Users Actually Mean

Published in ACL ARR 2026 May Submission (under review), 2026

Under review at ACL ARR 2026 May Submission. IntentEval is a benchmark for evaluating whether LLMs answer the user’s intended question, using human-derived probability distributions over interpretations and an intent-aware judge. It achieves 0.90 correlation with LMArena rankings.

Syntactic Prediction through Reinforcement Learning

Published in ACL ARR 2026 March Submission (under review), 2026

Under review at ACL ARR 2026 March Submission. This is my first paper and it studies reinforcement learning for hierarchical syntactic prediction in large language models.