Testing Frontier Large Language Models' Physics Literacy in Parallel Physical Worlds
arXiv:2607.00276v1 Announce Type: new Abstract: Current large-language-model (LLM) physics benchmarks are usually scored by answer accuracy, which cannot distinguish genuine reasoning from recall of familiar problem patterns and reveals little about where a model's reasoning breaks down. We introduce an auditable four-stage diagnostic that evaluates whether an LLM can reason inside an unfamiliar physics framework through induction, formulation, prediction, and review. The diagnostic combines loc...
arXiv cs.LG
·Dong Zhang
·
// relacionados
Leia também
Editorial
Kimi K3: a China lança o maior modelo aberto do mundo — e ele não é o maior por acaso
Blog
Modelos de peso aberto agora igualam o desempenho cibernético de ponta de apenas quatro meses atrás por uma fração do custo
Blog
O novo manual de IA do Pentágono trata a adoção lenta como um risco maior do que o alinhamento imperfeito
Blog