Publications

(2026). VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos. ICML 2026.

PDF Code

(2026). TIME: Temporal-Sensitive Multi-Dimensional Instruction Tuning and Robust Benchmarking for Video-LLMs. AAAI 2026, Oral.

PDF Code

(2025). PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning. arXiv preprint.

PDF Code

(2023). Unlocking the Power of Multimodal Learning for Emotion Recognition in Conversation. ACM MM 2023.

PDF Cite Code

(2023). A survey on video moment localization. ACM Computing Surveys.

PDF Cite

(2023). Siamese alignment network for weakly supervised video moment retrieval. TMM.

PDF Cite Code