Trustworthy AI

arXiv
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
AAAI 2026
Mitigating Hallucinations in Large Language Models via Causal Reasoning