CV
Education
- B.S. Computer Engineering, San Jose State University, 2004
- M.S. Computer Science, UNC Chapel Hill, 2010
- Ph.D in Computer Vision, UNC Chapel Hill, 2013
Work experience
- Oct 2020-Present: Sr. Applied Science Manager (L7)
- Oct 2015-Oct 2020: Sr. Applied Scientist (L6)
- May 2014-Oct 2015: Applied Scientist (L5)
- Aug 2013 - May 2014: Postdoctoral Research Associate
- Jan 2005 - Aug 2008: Software Engineer 2
Publications
- Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning Chun-Hsiao Yeh, Shengyi Qian, Manchen Wang, Yi Ma, Joseph Tighe, Fanyi Xiao, CVPR 2026 [pdf]
- Computer Use at the Edge of the Statistical Precipice Pierluca D'Oro, Sneha Silwal, William Wong, Yuxuan Sun, Fanyi Xiao, Manchen Wang, Eric Gan, Allen Bolourchi, Joseph Tighe, arXiv preprint 2026 [pdf]
- Hierarchical Procedural Meta-Reasoning for Generalizable Multimodal Agents Yao Fu, Shengyi Qian, Pierluca D'Oro, Fanyi Xiao, Honglak Lee, Joseph Tighe, Manchen Wang, ICLR Workshop on Agentic AI in the Wild: From Hallucinations to Reliable Autonomy 2026 [pdf]
- Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction Ce Zhang, Yale Song, Ruta Desai, Michael Louis Iuzzolino, Joseph Tighe, Gedas Bertasius, Satwik Kottur, WACV 2026 [pdf]
- Benchmarking Egocentric Multimodal Goal Inference for Assistive Wearable Agents Vijay Veerabadran, Fanyi Xiao, Nitin Kamra, Pedro Matias, Joy Chen, Caley Drooff, Brett D. Roads, Riley Williams, Ethan Henderson, Xuanyi Zhao, Kevin Carlberg, Joseph Tighe, Karl Ridgeway, NeurIPS Datasets and Benchmarks Track (Spotlight) 2025 [pdf]
- DigiData: Training and Evaluating General-Purpose Mobile Control Agents Yuxuan Sun, Manchen Wang, Shengyi Qian, William R. Wong, Eric Gan, Pierluca D'Oro, Alejandro Castillejo Munoz, Sneha Silwal, Pedro Matias, Nitin Kamra, Satwik Kottur, Nick Raines, Xuanyi Zhao, Joy Chen, Joseph Greer, Andrea Madotto, Allen Bolourchi, James Valori, Kevin Carlberg, Karl Ridgeway, Joseph Tighe, arXiv preprint 2025 [pdf]
- ADEPTS: A Capability Framework for Human-Centered Agent Design Pierluca D'Oro, Caley Drooff, Joy Chen, Joseph Tighe, arXiv preprint 2025 [pdf]
- Embodied AI Agents: Modeling the World Pascale Fung, Yoram Bachrach, Asli Celikyilmaz, Kamalika Chaudhuri, Delong Chen, Willy Chung, Emmanuel Dupoux, Hervé Jégou, Alessandro Lazaric, Arjun Majumdar, Andrea Madotto, Franziska Meier, Florian Metze, Théo Moutakanni, Juan Pino, Basile Terver, Joseph Tighe, Jitendra Malik, arXiv preprint 2025 [pdf]
- Benchmarking Zero-Shot Recognition with Vision-Language Models: Challenges on Granularity and Specificity Zhenlin Xu, Yi Zhu, Siqi Deng, Abhay Mittal, Yanbei Chen, Manchen Wang, Paolo Favaro, Joseph Tighe, Davide Modolo, CVPR Workshop on Multimodal Foundation Models 2024 [pdf]
- Learning for Transductive Threshold Calibration in Open-World Recognition Qin Zhang, Dongsheng An, Tianjun Xiao, Tong He, Qingming Tang, Ying Nian Wu, Joseph Tighe, Yifan Xing, CVPR 2024 [pdf]
- Threshold-Consistent Margin Loss for Open-World Deep Metric Learning Qin Zhang, Linghan Xu, Jun Fang, Qingming Tang, Ying Nian Wu, Joseph Tighe, Yifan Xing, ICLR 2024 [pdf]
- Early Action Recognition with Action Prototypes Guglielmo Camporese, Alessandro Bergamo, Xunyu Lin, Joseph Tighe, Davide Modolo, arXiv preprint 2023 [pdf]
- SkeleTR: Towards Skeleton-based Action Recognition in the Wild Haodong Duan, Mingze Xu, Bing Shuai, Davide Modolo, Zhuowen Tu, Joseph Tighe, Alessandro Bergamo, ICCV 2023 [pdf]
- ScaleDet: A Scalable Multi-Dataset Object Detector Yanbei Chen, Manchen Wang, Abhay Mittal, Zhenlin Xu, Paolo Favaro, Joseph Tighe, Davide Modolo, CVPR 2023 [pdf]
- An In-depth Study of Stochastic Backpropagation Jun Fang, Mingze Xu, Hao Chen, Bing Shuai, Zhuowen Tu, Joseph Tighe, NeurIPS 2022 [pdf]
- Large scale Real-world Multi-Person Tracking Bing Shuai, Alessandro Bergamo, Uta Buechler, Andrew Berneshawi, Alyssa Boden, Joseph Tighe, ECCV 2022 [pdf]
- PSS: Progressive sample selection for open-world visual representation learning Tianyue Cao, Yongxin Wang, Yifan Xing, Tianjun Xiao, Tong He, Zheng Zhang, Hao Zhou, Joseph Tighe, ECCV 2022 [pdf]
- MaCLR: Motion-aware contrastive Learning of representations for videos Fanyi Xiao, Joseph Tighe, Davide Modolo, ECCV 2022 [pdf]
- SCVRL: Shuffled Contrastive Video Representation Learning Michael Dorkenwald, Fanyi Xiao, Biagio Brattoli, Joseph Tighe, Davide Modolo, CVPR Workshop on Learning with Limited Labelled Data for Image and Video Understanding 2022 [pdf]
- TubeR: Tubelet transformer for video action detection Jiaojiao Zhao, Yanyi Zhang, Xinyu Li, Hao Chen, Bing Shuai, Mingze Xu, Chunhui Liu, Kaustav Kundu, Yuanjun Xiong, Davide Modolo, Ivan Marsic, Cees G.M. Snoek, Joseph Tighe, CVPR Oral 2022 [pdf]
- Id-free person similarity learning Bing Shuai, Xinyu Li, Kaustav Kundu, Joseph Tighe, CVPR 2022 [pdf]
- Hierarchical Self-supervised Representation Learning for Movie Understanding Fanyi Xiao, Kaustav Kundu, Joseph Tighe, Davide Modolo, CVPR 2022 [pdf]
- What to look at and where: Semantic and Spatial Refined Transformer for detecting human-object interactions ASM Iftekhar, Hao Chen, Kaustav Kundu, Xinyu Li, Joseph Tighe, Davide Modolo, CVPR Oral 2022 [pdf]
- Transfer of Representations to Video Label Propagation: Implementation Factors Matter Daniel McKee, Zitong Zhan, Bing Shuai, Davide Modolo, Joseph Tighe, Svetlana Lazebnik, arXiv preprint 2022 [pdf]
- Sscap: Self-supervised co-occurrence action parsing for unsupervised temporal action segmentation Zhe Wang, Hao Chen, Xinyu Li, Chunhui Liu, Yuanjun Xiong, Joseph Tighe, Charless Fowlkes, WACV 2022 [pdf]
- Nuta: Non-uniform temporal aggregation for action recognition Xinyu Li, Chunhui Liu, Bing Shuai, Yi Zhu, Hao Chen, Joseph Tighe, WACV 2022 [pdf]
- Video Contrastive Learning with Global Context Haofei Kuang, Yi Zhu, Zhi Zhang, Xinyu Li, Joseph Tighe, oren Schwertfeger, Cyrill Stachniss, Mu Li, ICCV workshop 2021 [pdf]
- VidTr: Video Transformer Without Convolutions Xinyu Li, Yanyi Zhang, Chunhui Liu, Bing Shuai, Yi Zhu, Biagio Brattoli, Hao Chen, Ivan Marsic, Joseph Tighe, ICCV 2021 [pdf]
- Single View Physical Distance Estimation using Human Pose Xiaohan Fei, Henry Wang, Xiangyu Zeng, Lin Lee Cheong, Meng Wang, Joseph Tighe, ICCV 2021 [pdf]
- Selective Feature Compression for Efficient Activity Recognition Inference Chunhui Liu, Xinyu Li, Hao Chen, Davide Modolo, Joseph Tighe, ICCV 2021 [pdf]
- MoDist: Motion Distillation for Self-supervised Video Representation Learning Fanyi Xiao, Joseph Tighe, Davide Modolo, arXiv preprint 2021 [pdf]
- SiamMOT: Siamese Multi-Object Tracking Bing Shuai, Andrew Berneshawi, Xinyu Li, Davide Modolo, Joseph Tighe, CVPR 2021 [pdf]
- Understanding the impact of mistakes on background regions in crowd counting Davide Modolo, Bing Shuai, Rahul Rama Varior, Joseph Tighe, WACV 2021 [pdf]
- A comprehensive study of deep video action recognition Yi Zhu, Xinyu Li, Chunhui Liu, Mohammadreza Zolfaghari, Yuanjun Xiong, Chongruo Wu, Zhi Zhang, Joseph Tighe, R Manmatha, Mu Li, arXiv preprint 2020 [pdf]
- Exploiting weakly supervised visual patterns to learn from partial annotations Kaustav Kundu, Erhan Bas, Michael Lam, Hao Chen, Davide Modolo, Joseph Tighe, NeurIPS 2020 [pdf]
- Directional temporal modeling for action recognition Xinyu Li, Bing Shuai, Joseph Tighe, ECCV 2020 [pdf]
- Rethinking zero-shot video classification: End-to-end training for realistic applications Biagio Brattoli, Joseph Tighe, Fedor Zhdanov, Pietro Perona, Krzysztof Chalupka, CVPR 2020 [pdf]
- Combining detection and tracking for human pose estimation in videos Manchen Wang, Joseph Tighe, Davide Modolo, CVPR 2020 [pdf]
- Multi-object tracking with siamese track-rcnn Bing Shuai, Andrew G Berneshawi, Davide Modolo, Joseph Tighe, arXiv preprint 2020 [pdf]
- Action recognition with spatial-temporal discriminative filter banks Brais Martinez, Davide Modolo, Yuanjun Xiong, Joseph Tighe, ICCV 2019 [pdf]
- Scale-Aware Attention Network for Crowd Counting Rahul Rama Varior, Bing Shuai, Joseph Tighe, Davide Modolo, arXiv preprint 2019 [pdf]
- Scene parsing with object instance inference using regions and per-exemplar detectors Joseph Tighe, Marc Niethammer, Svetlana Lazebnik, IJCV 2014 [pdf]
- Scene Parsing with Object Instances and Occlusion Ordering Joseph Tighe, Marc Niethammer, Svetlana Lazebnik, CVPR 2014 [pdf]
- Combining semantic scene priors and haze removal for single image depth estimation Ke Wang, Enrique Dunn, Joseph Tighe, Jan-Michael Frahm, WACV 2014 [pdf]
- Finding things: Image parsing with regions and per-exemplar detectors Joseph Tighe, Svetlana Lazebnik, CVPR oral 2013 [pdf]
- Improved Geometric Verification for Large Scale Landmark Image Collections. Rahul Raguram, Joseph Tighe, Jan-Michael Frahm, BMVC 2012 [pdf]
- Understanding scenes on many levels Joseph Tighe, Svetlana Lazebnik, ICCV 2011 [pdf]
- Superparsing: scalable nonparametric image parsing with superpixels Joseph Tighe, Svetlana Lazebnik, ECCV 2010 [pdf]
Talks