Jihyung Kil
Computer Science · The Ohio State University
Publications
23
Citations
91
Est. group size
~1
Recurring co-author estimate
Active years
10
Publishing since 2017
Jihyung Kil works on multimodal machine learning, focusing on how AI systems combine vision and language, such as answering questions about images, understanding text embedded in scenes, navigating environments from language instructions, and generating personalized or chart-based content. Much of the work involves improving reasoning in visual question answering and grounding language models in visual or interaction data like eye-tracking and GUI screens. This research is relevant to students interested in vision-language models, multimodal reasoning, and applied natural language processing.
Publication output was sparse before 2021 but has grown notably since, peaking in 2024 with continued activity into 2025-2026.
Generated by claude-sonnet-5 from public bibliographic data · Jul 20, 2026
- Reasoning-Based Personalized Generation for Users with Sparse Data
Open MIND · 2026
- Reasoning-Based Personalized Generation for Users with Sparse Data
arXiv (Cornell University) · 2026
- Gaze2Prompt: Turning Eye-Tracking Data into Visual Prompts for Multimodal LLMs
2025
- GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
arXiv (Cornell University) · 2025
- Grounded Generation of Embellished Bar Chart Ensuring Chart Integrity
2025
- II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
2024
- II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
arXiv (Cornell University) · 2024
- PreSTU: Pre-Training for Scene-Text Understanding
2023
- PreSTU: Pre-Training for Scene-Text Understanding
arXiv (Cornell University) · 2022
- One Step at a Time: Long-Horizon Vision-and-Language Navigation with Milestones
arXiv (Cornell University) · 2022
- Discovering the Unknown Knowns: Turning Implicit Knowledge in the Dataset into Explicit Training Examples for Visual Question Answering
Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing · 2021
- Revisiting Document Representations for Large-Scale Zero-Shot Learning
2021
- Revisiting Document Representations for Large-Scale Zero-Shot Learning
arXiv (Cornell University) · 2021
- Discovering the Unknown Knowns: Turning Implicit Knowledge in the Dataset into Explicit Training Examples for Visual Question Answering
arXiv (Cornell University) · 2021
- arXiv (Cornell University)×11
- 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)×1
- Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing×1
- CRI eBooks×1
- Open MIND×1
- Pranav Maneriker
Computer Science · The Ohio State University
- Hoin Jung
Computer Science · Purdue University West Lafayette
- Chan Hee Song
Computer Science · The Ohio State University
- AJ Piergiovanni
Computer Science · Indiana University
- Jeffrey Mark Siskind
Computer Science · Purdue University West Lafayette
This profile was generated automatically from public scholarly data (OpenAlex). Group size and activity levels are estimates derived from co-authorship patterns.
Last updated Jul 19, 2026.
Claim or correct this profile