, ,

INFONET Journal Club: “VX2TEXT: End-to-End Learning of Video-Based Text Generation From Multimodal Inputs”

20260529 INFONET Journal Club

  • Presenter: Minjun Song