V, Damodaran, Balasubramanian M, Jibukumar M G, and Smitha I S. “A Hybrid Vision–Language Framework For Unified Image–Video Captioning And Semantic Visual Question Answering”. International Journal of Artificial Intelligence and Machine Learning 6, no. 7s (July 19, 2026): 790–807. Accessed August 24, 2026. https://svedbergopen.com/index.php/ijaiml/article/view/1125.