← People
Chen Zhao

Chen Zhao following

NYU Shanghai
@henryzhao4321Papers in the feed →

Papers · 35
  1. GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents
    arXiv.org2026-06-22alphaXiv arXiv S2
  2. MMGist: A Comprehensive Multimodal Benchmark for 2027
    arXiv.org2026-06-21alphaXiv arXiv S2
  3. From "Weak" Signals to Strong Models: Preference Delta Aggregation with LoRA Merging
    arXiv.org2026-05-29alphaXiv arXiv S2
  4. Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
    Annual Meeting of the Association for Computational Linguistics2026-05-05alphaXiv arXiv S2
  5. Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs
    arXiv.org2026-03-10alphaXiv arXiv S2
  6. A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
    Annual Meeting of the Association for Computational Linguistics2026-03-09alphaXiv arXiv S2
  7. RPDR: A Round-trip Prediction-Based Data Augmentation Framework for Long-Tail Question Answering
    Conference on Empirical Methods in Natural Language Processing2026-02-19alphaXiv arXiv S2
  8. SAGE: Benchmarking and Improving Retrieval for Deep Research Agents
    arXiv.org2026-02-05alphaXiv arXiv S2
  9. Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
    arXiv.org2026-01-19alphaXiv arXiv S2
  10. Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision
    Annual Meeting of the Association for Computational Linguistics2026-01-19alphaXiv arXiv S2
  11. Deconstructing Multimodal Mathematical Reasoning: Towards a Unified Perception-Alignment-Reasoning Paradigm
    arXiv.org2026S2
  12. LimRank: Less is More for Reasoning-Intensive Information Reranking
    Conference on Empirical Methods in Natural Language Processing2025-10-27alphaXiv arXiv S2
  13. FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain
    Conference on Empirical Methods in Natural Language Processing2025-10-17alphaXiv arXiv S2
  14. MRMR: A Realistic and Expert-Level Multidisciplinary Benchmark for Reasoning-Intensive Multimodal Retrieval
    arXiv.org2025-10-10alphaXiv arXiv S2
  15. FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering
    Conference on Empirical Methods in Natural Language Processing2025-10-07alphaXiv arXiv S2
  16. PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
    arXiv.org2025-10-07alphaXiv arXiv S2
  17. PQReCS: Accelerating Code Search with Product Quantization and Result Re-ranking Optimization
    2025 5th International Conference on Artificial Intelligence, Automation and High Performance Computing (AIAHPC)2025-09-19S2
  18. RepoForge: Training a SOTA Fast-thinking SWE Agent with an End-to-End Data Curation Pipeline Synergizing SFT and RL at Scale
    arXiv.org2025-08-03alphaXiv arXiv S2
  19. SciArena: An Open Evaluation Platform for Non-Verifiable Scientific Literature-Grounded Tasks
    Neural Information Processing Systems2025-07-01alphaXiv arXiv S2
  20. SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
    arXiv.org2025-06-05alphaXiv arXiv S2
  21. Inter-Passage Verification for Multi-evidence Multi-answer QA
    Annual Meeting of the Association for Computational Linguistics2025-05-31alphaXiv arXiv S2
  22. Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective
    Conference on Empirical Methods in Natural Language Processing2025-05-21alphaXiv arXiv S2
  23. Physics: Benchmarking Foundation Models on University-Level Physics Problem Solving
    Annual Meeting of the Association for Computational Linguistics2025-03-26alphaXiv arXiv S2
  24. MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search
    Conference on Empirical Methods in Natural Language Processing2025-03-26alphaXiv arXiv S2
  25. MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
    Computer Vision and Pattern Recognition2025-01-21alphaXiv arXiv S2
  26. SciSketch: An Open-source Framework for Automated Schematic Diagram Generation in Scientific Papers
    Conference on Empirical Methods in Natural Language Processing2025S2
  27. Are Multimodal LLMs Robust Against Adversarial Perturbations? RoMMath: A Systematic Evaluation on Multimodal Math Reasoning
    North American Chapter of the Association for Computational Linguistics2025S2
  28. SportReason: Evaluating Retrieval-Augmented Reasoning across Tables and Text for Sports Question Answering
    Conference on Empirical Methods in Natural Language Processing2025S2
  29. MRAG: A Modular Retrieval Framework for Time-Sensitive Question Answering
    Conference on Empirical Methods in Natural Language Processing2025S2
  30. FinDVer: Explainable Claim Verification over Long and Hybrid-content Financial Documents
    Conference on Empirical Methods in Natural Language Processing2024-11-08alphaXiv arXiv S2
  31. SynTQA: Synergistic Table-based Question Answering via Mixture of Text-to-SQL and E2E TQA
    Conference on Empirical Methods in Natural Language Processing2024-09-25alphaXiv arXiv S2
  32. KnowledgeFMath: A Knowledge-Intensive Math Reasoning Dataset in Finance Domains
    Annual Meeting of the Association for Computational Linguistics2024S2
  33. TaPERA: Enhancing Faithfulness and Interpretability in Long-Form Table QA by Content Planning and Execution-based Reasoning
    Annual Meeting of the Association for Computational Linguistics2024S2
  34. Are MLLMs Robust Against Adversarial Perturbations? R O MM ATH : A Systematic Evaluation on Multimodal Math Reasoning
    S2
  35. P HYSICS : B ENCHMARKING F OUNDATION M ODELS FOR P ROBLEM S OLVING IN P HYSICS
    S2