Dense Structural Priors for Sparse Functional Landmark Localization in Surgical Videos
arXiv:2606.31007v1 Announce Type: new Abstract: Vision foundation models such as SAM 3 can provide transferable object-level structure across diverse surgical video conditions, but segmentation outputs do not explicitly encode the action-conditioned semantics that define functional surgical landmarks. Estimating instrument extent and geometry differs from localizing the tip or anchor relevant to clipping, grasping, or dissecting. We investigate vision foundation model-enabled sparse action-aware...
arXiv cs.CV
·Chenyan Jing, Hao Ding, Lalithkumar Seenivasan, Jacob M. Delgado L\'opez, Mathias Unberath
·
// relacionados
Leia também
Editorial
Evidence-RL: como obrigar um modelo de visão a de fato olhar para a imagem
Blog
Colaboração entre drone (VANT) e veículo terrestre não tripulado (VTNT) para navegação autônoma em terreno coberto de neve
Blog
XEns-CKD: Uma abordagem explicável baseada em ensemble para detecção do estágio de doença renal crônica
Blog