Return to Article Details A Hybrid Vision–Language Framework For Unified Image–Video Captioning And Semantic Visual Question Answering Download Download PDF