V, Damodaran, et al. “A Hybrid Vision–Language Framework For Unified Image–Video Captioning And Semantic Visual Question Answering”. International Journal of Artificial Intelligence and Machine Learning, vol. 6, no. 7s, July 2026, pp. 790-07, https://svedbergopen.com/index.php/ijaiml/article/view/1125.