Picture for Zijian Chen

Zijian Chen

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

Add code
Jun 30, 2026
Viaarxiv icon

GeoR-Bench: Evaluating Geoscience Visual Reasoning

Add code
May 12, 2026
Viaarxiv icon

ORBIT: Scalable and Verifiable Data Generation for Search Agents on a Tight Budget

Add code
Apr 02, 2026
Viaarxiv icon

A^3: Towards Advertising Aesthetic Assessment

Add code
Mar 25, 2026
Viaarxiv icon

UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities

Add code
Mar 24, 2026
Viaarxiv icon

InterveneBench: Benchmarking LLMs for Intervention Reasoning and Causal Study Design in Real Social Systems

Add code
Mar 16, 2026
Viaarxiv icon

AgentIR: Reasoning-Aware Retrieval for Deep Research Agents

Add code
Mar 05, 2026
Viaarxiv icon

SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond

Add code
Mar 02, 2026
Viaarxiv icon

STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction

Add code
Feb 12, 2026
Viaarxiv icon

GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction

Add code
Jan 19, 2026
Viaarxiv icon