MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
-
etri-vilab/MultihopSpatial
Viewer ⢠Updated ⢠15.8k ⢠764 ⢠4 -
etri-vilab/MultiHopSpatial-Qwen3-VL-4B-Instruct
Image-Text-to-Text ⢠4B ⢠Updated ⢠55 ⢠1 -
etri-vilab/MultiHopSpatial-Qwen3-VL-8B-Instruct
Image-Text-to-Text ⢠9B ⢠Updated ⢠43 -
etri-vilab/MultiHopSpatial-Qwen3-VL-32B-Instruct
Image-Text-to-Text ⢠33B ⢠Updated ⢠35