[1]
D. V, B. M, J. M G, and S. I S, “A Hybrid Vision–Language Framework For Unified Image–Video Captioning And Semantic Visual Question Answering”, IJAIML, vol. 6, no. 7s, pp. 790–807, Jul. 2026.