Washim Uddin Mondal
Computer Science · Purdue University West Lafayette
Publications
53
Citations
124
Est. group size
~2
Recurring co-author estimate
Active years
10
Publishing since 2017
Washim Uddin Mondal works on theoretical foundations of reinforcement learning, particularly proving mathematical guarantees (such as convergence and regret bounds) for algorithms that optimize long-run average rewards, including versions with constraints (limits on resource use or safety). Some work also applies machine learning and network modeling to wireless communication systems (e.g., cellular coverage estimation) and to modeling recovery after disasters in interconnected infrastructure networks.
Publication output has grown substantially over the past decade, rising from just a few papers per year before 2020 to a peak of 15 in 2024, indicating an accelerating and increasingly active research pace.
Generated by claude-sonnet-5 from public bibliographic data · Jul 20, 2026
- Global Convergence of Average Reward Constrained MDPs with Neural Critic and General Policy Parameterization
Open MIND · 2026
- Global Convergence of Average Reward Constrained MDPs with Neural Critic and General Policy Parameterization
arXiv (Cornell University) · 2026
- Match or Replay: Self Imitating Proximal Policy Optimization
arXiv (Cornell University) · 2026
- Match or Replay: Self Imitating Proximal Policy Optimization
arXiv (Cornell University) · 2026
- Uplink NOMA-Aided Multi-Device Multi-Target Integrated Sensing and Communication
2025
- Finite-Sample Analysis of Policy Evaluation for Robust Average Reward Reinforcement Learning
arXiv (Cornell University) · 2025
- Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm
arXiv (Cornell University) · 2025
- An agent-based model of post-disaster recovery in multilayer socio-physical networks
Sustainable Cities and Society · 2024
- Near-Perfect Coverage Manifold Estimation in Cellular Networks via Conditional GAN
IEEE Networking Letters · 2024
- Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
Proceedings of the AAAI Conference on Artificial Intelligence · 2024
- Sample-Efficient Constrained Reinforcement Learning with General Parameterization
arXiv (Cornell University) · 2024
- Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
arXiv (Cornell University) · 2024
- Near-perfect Coverage Manifold Estimation in Cellular Networks via conditional GAN
arXiv (Cornell University) · 2024
- Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
arXiv (Cornell University) · 2024
- An Agent-Based Model of Post-Disaster Recovery in Multilayer Socio-Physical Networks
SSRN Electronic Journal · 2024
- arXiv (Cornell University)×25
- IEEE Communications Letters×4
- IEEE Transactions on Cognitive Communications and Networking×4
- IEEE Journal of Biomedical and Health Informatics×1
- Sustainable Cities and Society×1
- Jiayu Chen
Computer Science · Purdue University West Lafayette
- Tengyu Xu
Computer Science · The Ohio State University
- Zaiwei Chen
Computer Science · Purdue University West Lafayette
- Andrew Perrault
Computer Science · The Ohio State University
- Abhishek Gupta
Computer Science · The Ohio State University
This profile was generated automatically from public scholarly data (OpenAlex). Group size and activity levels are estimates derived from co-authorship patterns.
Last updated Jul 20, 2026.
Claim or correct this profile