Framework for auditing the physical state-transition commitments of vision-language models. Instead of scoring only the answer, it elicits a typed trace, verifies it with a hybrid checker, and surfaces hidden inconsistency. Includes WMW-TRACEBANK: 200 validated traces across 17 physics families + 3,200 preference pairs.
benchmark evaluation dataset ai-safety vlm interpretability preference-learning world-models dpo physical-reasoning llm faithfulness vision-language-models reasoning-physics
-
Updated
May 31, 2026 - Python