Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification Paper • 2609.30467 • Published 13 days ago • 12
Medical Text Simplification: Optimizing for Readability with Unlikelihood Training and Reranked Beam Search Decoding Paper • 2310.11191 • Published Oct 26, 2023
Same Verdict, Different Reasons: LLM-as-a-Judge and Clinician Disagreement on Medical Chatbot Completeness Paper • 2604.16383 • Published Mar 26
Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification Paper • 2609.30467 • Published 13 days ago • 12
Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification Paper • 2609.30467 • Published 13 days ago • 12
MedScore: Generalizable Factuality Evaluation of Free-Form Medical Answers by Domain-adapted Claim Decomposition and Verification Paper • 2505.18452 • Published May 24, 2025 • 4
MedScore: Generalizable Factuality Evaluation of Free-Form Medical Answers by Domain-adapted Claim Decomposition and Verification Paper • 2505.18452 • Published May 24, 2025 • 4 • 1
MedScore: Generalizable Factuality Evaluation of Free-Form Medical Answers by Domain-adapted Claim Decomposition and Verification Paper • 2505.18452 • Published May 24, 2025 • 4