Updated 2026.10.04

Jinhui Ye 叶劲辉

PhD student @ HKUST

Research interests

Embodied intelligence, vision-language-action models, generalist robot learning, and long-form video understanding.

Education

The Hong Kong University of Science and Technology

PhD in Computer Science

Advisor: Prof. Jiaya Jia

2025.09 — present

The Hong Kong University of Science and Technology (Guangzhou)

MPhil in Artificial Intelligence

Advisors: Prof. Hui Xiong and Prof. Junwei Liang

2022.09 — 2025.04

South China University of Technology

BSc in Software Engineering · Minor in Finance

2018.09 — 2022.07

Internships & research visits

Alibaba · Qwen

Research Intern

Training and evaluation infrastructure for Qwen-VLA.

2025.10 — 2026

Shanghai AI Laboratory

Research Intern

Spatially grounded robot learning; InternVLA-M1 and ST4VLA.

2025.02 — 2025.08

Carnegie Mellon University · Language Technologies Institute

Visiting Student

Embodied memory and retrieval with Prof. Yonatan Bisk.

2024.09 — 2025.03

Stanford University · Vision and Learning Lab

Research Intern

Long-form video understanding and temporal search.

2023.12 — 2024.10

Tencent AI Lab

Research Intern

Sign language translation with Xing Wang and Wenxiang Jiao.

2021.08 — 2022.08

Selected research & open source

StarVLA Founder and lead maintainer

Open-source infrastructure for building, training, and evaluating vision-language-action models.

InternVLA-M1 / ST4VLA Core contributor / first author

Spatially grounded robot policies. Core contributor to InternVLA-M1; first author of ST4VLA (ICLR 2026).

Qwen-VLA Co-author

Contributions to training and evaluation infrastructure across robot embodiments and tasks.

Selected publications & reports

* Equal contribution

  1. Less is More: Reducing Complexity in Vision-Language-Action Systems

    Jinhui Ye*, Ning Gao*, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

    ECCV 2026

  2. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

    Qiuyue Wang, Mingsheng Li, Jian Guan, Jinhui Ye, Sicheng Xie, Yitao Liu, et al.

    Technical Report 2026

  3. ST4VLA: Spatially Guided Training for Vision-Language-Action Model

    Jinhui Ye*, Fangjing Wang*, Ning Gao*, Junqiu Yu*, Yangkun Zhu, Bin Wang, Jinyu Zhang, Weiyang Jin, Yanwei Fu, Feng Zheng, Yilun Chen, Jiangmiao Pang

    ICLR 2026

  4. StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing

    StarVLA Community

    Technical Report 2026

  5. Re-thinking Temporal Search for Long-Form Video Understanding

    Jinhui Ye*, Zihan Wang*, Haosen Sun, Keshigeyan Chandrasegaran, Zane Durante, Cristobal Eyzaguirre, Yonatan Bisk, Juan Carlos Niebles, Ehsan Adeli, Li Fei-Fei, Jiajun Wu, Manling Li

    CVPR 2025

  6. MolErr2Fix: Benchmarking LLM Trustworthiness in Chemistry via Modular Error Detection, Localization, Explanation, and Revision

    Yuyang Wu*, Jinhui Ye*, Shuhao Zhang*, Lu Dai, Yonatan Bisk, Olexandr Isayev

    EMNLP · Oral 2025

  7. FACE: A General Framework for Mapping Collaborative Filtering Embeddings into LLM Tokens

    Chao Wang*, Yixin Song*, Jinhui Ye, Chuan Qin, Dazhong Shen, Lingfeng Liu, Xiang Wang, Yanyong Zhang

    NeurIPS 2025

  8. Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding

    Weiyu Guo, Ziyang Chen, Shaoguang Wang, Jianxiang He, Yijie Xu, Jinhui Ye, Ying Sun, Hui Xiong

    NeurIPS 2025

  9. SePer: Measure Retrieval Utility Through the Lens of Semantic Perplexity Reduction

    Lu Dai, Yijie Xu, Jinhui Ye, Hao Liu, Hui Xiong

    ICLR · Spotlight 2025

  10. Improving Gloss-free Sign Language Translation by Reducing Representation Density

    Jinhui Ye, Xing Wang, Wenxiang Jiao, Junwei Liang, Hui Xiong

    NeurIPS 2024

  11. Cross-modality Data Augmentation for End-to-End Sign Language Translation

    Jinhui Ye, Wenxiang Jiao, Xing Wang, Zhaopeng Tu, Hui Xiong

    Findings of the Association for Computational Linguistics: EMNLP 2023

  12. Scaling Back-Translation with Domain Text Generation for Sign Language Gloss Translation

    Jinhui Ye*, Wenxiang Jiao*, Xing Wang, Zhaopeng Tu

    EACL 2023

Honors & awards

  • 2025
    EAI-100 Top 10 Open-Source Projects

    StarVLA · project recognition; announced in March 2026

  • 2023
    1st and 2nd Place · Pazhou Algorithm Contest

    Two projects in the Human–Machine Interaction Track

  • 2022
    Outstanding Undergraduate Thesis

    South China University of Technology

  • 2021
    National Scholarship

    China