Picture for Zhaochong An

Zhaochong An

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

Add code
Jul 28, 2026
Viaarxiv icon

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

Add code
Jul 28, 2026
Viaarxiv icon

Track2View: 4D-Consistent Camera-Controlled Video Generation via Paired 3D Point Tracks

Add code
Jun 14, 2026
Viaarxiv icon

Stitched Value Model for Diffusion Alignment

Add code
May 19, 2026
Viaarxiv icon

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

Add code
Mar 27, 2026
Viaarxiv icon

Video Understanding: From Geometry and Semantics to Unified Models

Add code
Mar 18, 2026
Viaarxiv icon

Revisiting the Perception-Distortion Trade-off with Spatial-Semantic Guided Super-Resolution

Add code
Mar 14, 2026
Viaarxiv icon

VecGlypher: Unified Vector Glyph Generation with Language Models

Add code
Feb 25, 2026
Viaarxiv icon

Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning

Add code
Jan 28, 2026
Viaarxiv icon

HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming

Add code
Dec 24, 2025
Figure 1 for HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
Figure 2 for HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
Figure 3 for HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
Figure 4 for HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
Viaarxiv icon