Signal2026-07-28
arXiv

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

Part of

MotionVLA: Vision-Language-Action Model for Humanoid Motion