Topic: record

5 stories found

Wednesday, August 26, 2026

research35

RENDER: Controlling Reader-Facing Evidence in LLM Memory Evaluation

RENDER is a new benchmark introduced to evaluate language models' memory by controlling how reader-facing evidence is presented, addressing limitations in current evaluations that treat input history inconsistently. This matters because it ensures more standardized and fair assessments of memory capabilities across different systems.

arxiv.orgโ†—

Monday, August 24, 2026

research40

An ambiguity taxonomy for evaluating large language model performance on clinical registry abstraction: a multi-site prospective study

A study evaluated large language models' ability to answer clinical registry questions using raw EMR data, aiming to improve accuracy in extracting relevant information from medical records for cardiac registries. This research is crucial as it assesses the reliability of AI in handling complex medical data, which could enhance automated health data processing and analysis.

arxiv.orgโ†—

๐ŸŒฟ That's all for now. Come back tomorrow.

5 of 5 items shown. Sources: 107 days indexed.