Incremental, multi-level processing for comprehending visually situated dialogue in humanrobot interaction | AMiner