Paper Everyday

One AI research paper, explained clearly — every single day. Skip the jargon, get the insight.

125 papers explained & growing daily

Category

Computer Vision and Pattern Recognition(27 papers)

arXivSep 1

TempCloze: Can Video-LLMs Identify the Missing Middle?

Wenqi Pei +6 more

Computer Vision and Pattern RecognitionArtificial Intelligence
Read explanation
arXivSep 10

FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation

Vladislav Bargatin +3 more

Computer Vision and Pattern Recognition
Read explanation
arXivSep 10

Mi-Ripple: Restoring Images Degraded by Iterative AI Editing

Jiayin Chen +2 more

Computer Vision and Pattern Recognition
Read explanation
arXivSep 7

SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem

Soohyun Ryu +2 more

Computer Vision and Pattern RecognitionArtificial Intelligence
Read explanation
arXivSep 10

SenseNova-U1.5: Towards Native Unified Visual Intelligence

Haiwen Diao +64 more

Computer Vision and Pattern Recognition
Read explanation
arXivSep 6

TransNormal-2: Geometry-Grounded Rectified Flow with Edge-Aware Decoding for Precise Normal Estimation

Mingwei Li +2 more

Computer Vision and Pattern Recognition
Read explanation
arXivSep 8

CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs

Nhat-Tan Bui +9 more

Computer Vision and Pattern RecognitionMachine Learning
Read explanation
arXivSep 6

Agentic Visual Generation: From Generative Models to Agentic Control

Yinming Huang +9 more

Computer Vision and Pattern Recognition
Read explanation
arXivSep 8

Mask Forcing: Improving Autoregressive Video Diffusion Distillation via Dual-Noise Masking Rollout

Zhuoran Zhao +9 more

Computer Vision and Pattern Recognition
Read explanation
arXivSep 4

SceneMosaic: Efficient and Diverse Simulation-Ready Scene Generation via Hybrid Agentic Layout Evolution

Xingjian Ran +5 more

Computer Vision and Pattern Recognition
Read explanation
arXivSep 8

Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation

Igor Pavlovic +8 more

Computer Vision and Pattern RecognitionMachine Learning
Read explanation
arXivSep 5

DriveZero: End-to-End Driving Beyond Human Demonstrations

Hao He +19 more

Computer Vision and Pattern Recognition
Read explanation
arXivSep 3

ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation

Javier del Pino +4 more

Computer Vision and Pattern RecognitionArtificial Intelligence
Read explanation
arXivSep 3

AdaptVPR: Route-Aware Hard Positive Generation for Robust Visual Place Recognition

Shunpeng Chen +8 more

Computer Vision and Pattern Recognition
Read explanation
arXivAug 29

To See a World in a Living Context: Unified Indoor-Outdoor Urban World Generation

Xiaobin Huang +5 more

Computer Vision and Pattern Recognition
Read explanation
arXivSep 2

ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding

Jitai Hao +3 more

Computer Vision and Pattern RecognitionComputation and Language
Read explanation
arXivSep 4

WorldSculpt: Generating Compositional Worlds from Grounded Videos

Muyao Niu +11 more

Computer Vision and Pattern Recognition
Read explanation
arXivAug 25

TorchMorph: CUDA-accelerated Morphological Transforms

Kai Zhao

Computer Vision and Pattern Recognition
Read explanation
arXivAug 25

MoTE: Mixture of Task Experts for Multi-Task Video Understanding

Muhammad Asad Ali +3 more

Computer Vision and Pattern RecognitionMachine Learning
Read explanation
arXivAug 25

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

Andreas Hochlehnert +11 more

Computer Vision and Pattern RecognitionArtificial IntelligenceMachine Learning
Read explanation
arXivAug 25

From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms

Jiangning Zhang +2 more

Computer Vision and Pattern Recognition
Read explanation
arXivAug 25

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

Wenxuan Shen +2 more

Computer Vision and Pattern Recognition
Read explanation
arXivAug 25

On-Policy Self-Distillation in Diffusion Models

Wei Zhou +16 more

Computer Vision and Pattern Recognition
Read explanation
arXivAug 25

WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

Junjie Zhou +5 more

Computer Vision and Pattern RecognitionComputation and LanguageInformation Retrieval
Read explanation
arXivAug 20

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

Yunheng Li +6 more

Computer Vision and Pattern Recognition
Read explanation
arXivAug 21

EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment

Guray Ozgur +3 more

Computer Vision and Pattern Recognition
Read explanation
arXivAug 20

Tomatoes, Potatoes, and Onions: Questioning the Need for Faces in Face Presentation Attack Detection

Guray Ozgur +2 more

Computer Vision and Pattern Recognition
Read explanation

Category

Artificial Intelligence(22 papers)

arXivAug 28

HyQuant: Hybrid-Precision Quantization for LLM Attention

Jiatong Ding +11 more

Artificial Intelligence
Read explanation
arXivSep 9

An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics

Ivan Moshkov +5 more

Artificial Intelligence
Read explanation
arXivSep 8

Procedural Graphs: Self-Evolving Execution Structures for LLM Agents

Yuxing Lu +3 more

Artificial IntelligenceComputation and LanguageMultiagent Systems
Read explanation
arXivSep 6

Reason Through the Latent! Making Latent Visual Reasoning Necessary

Suhyeong Park +2 more

Artificial IntelligenceComputation and LanguageComputer Vision and Pattern RecognitionMachine Learning
Read explanation
arXivSep 3

When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference

Ismail Erbas +2 more

Artificial IntelligenceMachine LearningOpticsQuantitative Methods
Read explanation
arXivSep 4

τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction

Quan Shi +3 more

Artificial Intelligence
Read explanation
arXivSep 3

MaxKernel: Agentic Kernel Generation for TPUs

Shangkun Wang +9 more

Artificial IntelligencePerformanceProgramming Languages
Read explanation
arXivSep 4

RISE: Recursive Improvement via Self-Extrapolating Policy Distillation

Yang Li +2 more

Artificial Intelligence
Read explanation
arXivSep 4

Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference

Mostafa Elhoushi +8 more

Artificial Intelligence
Read explanation
arXivSep 3

The Attention Triangle in Audio-Video Models

Sagi Polaczek +6 more

Artificial Intelligence
Read explanation
arXivSep 3

Iris: Climbing to the Search Frontier

Ziyuan Liu +8 more

Artificial Intelligence
Read explanation
arXivSep 2

Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems

Yihang Chen +5 more

Artificial Intelligence
Read explanation
arXivAug 24

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment

Stephen Chung +2 more

Artificial IntelligenceDiscrete MathematicsMultiagent Systems
Read explanation
arXivAug 25

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback

Boyang Liu +17 more

Artificial Intelligence
Read explanation
arXivAug 25

When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows

Yiheng Sun +5 more

Artificial IntelligenceMultiagent Systems
Read explanation
arXivAug 24

Automata from Agent Traces: Failure and Next-Step Prediction

Seonglae Cho +6 more

Artificial IntelligenceComputation and LanguageMachine Learning
Read explanation
arXivAug 24

AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace

Seonglae Cho, Donghyun Lee

Artificial IntelligenceSoftware Engineering
Read explanation
arXivAug 25

Meta^n: Recursive Self-Improvement through Emergent Depth

Zae Myung Kim +3 more

Artificial IntelligenceComputation and LanguageSystems and Control
Read explanation
arXivAug 25

Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

Zhaochen Yu +7 more

Artificial IntelligenceComputation and Language
Read explanation
arXivAug 24

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

Sungho Park +12 more

Artificial IntelligenceComputation and LanguageMachine LearningMultiagent SystemsSoftware Engineering
Read explanation
arXivAug 23

ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts

YuanHang Xiao

Artificial Intelligence
Read explanation
arXivAug 24

From Generation to Simulation: How Far Are World Models from Being True Simulators?

Tong Wang +5 more

Artificial IntelligenceComputer Vision and Pattern Recognition
Read explanation

Category

Machine Learning(19 papers)

arXivSep 10

Beyond Solver Verdicts: Generative Reward Models for Autoformalization

Vikash Singh +7 more

Machine LearningComputation and Language
Read explanation
arXivSep 9

MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes

Remco Hendriks

Machine LearningArtificial IntelligenceComputation and Language
Read explanation
arXivSep 8

Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks

Hongbang Yuan +2 more

Machine LearningArtificial IntelligenceComputation and Language
Read explanation
arXivSep 7

Kalman Delta Networks: Uncertainty-aware Associative Memory

Ngoc Bui +2 more

Machine LearningArtificial Intelligence
Read explanation
arXivSep 7

Online Draft Co-Training for Speculative Decoding in Large-Scale, Long-Context RL Post-Training

Zili Wang +4 more

Machine LearningDistributed, Parallel, and Cluster Computing
Read explanation
arXivSep 8

Miles v0.1: Production-Level Post-Training

RadixArk +12 more

Machine LearningComputation and Language
Read explanation
arXivSep 4

BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference

Janghyeon Kim +3 more

Machine LearningComputation and Language
Read explanation
arXivSep 8

Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation

Youngrok Park +8 more

Machine LearningComputation and Language
Read explanation
arXivSep 2

Causal Foundation Models

Christopher Stith +2 more

Machine LearningMachine Learning
Read explanation
arXivSep 2

Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation

Zhiwei Zhang +8 more

Machine LearningArtificial IntelligenceComputation and Language
Read explanation
arXivAug 26

One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation

Justin Robert, Raheel Qader

Machine LearningArtificial IntelligenceComputation and Language
Read explanation
arXivSep 3

FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

Zixun Huang +3 more

Machine LearningArtificial Intelligence
Read explanation
arXivSep 3

Unlocking Lossless Speedups in LLMs via Discrete Diffusion

Subham Sekhar Sahoo +16 more

Machine Learning
Read explanation
arXivAug 31

Group Adaptive Clipping Policy Optimization

Sheng Jia +3 more

Machine LearningComputation and Language
Read explanation
arXivAug 25

On-policy Distillation with Verifiable Reward

Wenze Lin +7 more

Machine LearningArtificial Intelligence
Read explanation
arXivAug 25

Best Practice Critic Optimization

Penghui Qi +2 more

Machine LearningArtificial IntelligenceComputation and Language
Read explanation
arXivAug 23

What AstroPT knows about galaxies, and what that can teach us about LLMs

UniverseTBD +4 more

Machine LearningInstrumentation and Methods for Astrophysics
Read explanation
arXivAug 14

Hybrid Quantum-inspired Kolmogorov-Arnold Networks for Privacy-Aware Federated Biosignal Learning

Chun-Hua Lin +9 more

Machine LearningArtificial IntelligenceDistributed, Parallel, and Cluster ComputingEmerging TechnologiesQuantum Physics
Read explanation
arXivAug 24

RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling

Ziyuan Wang +4 more

Machine LearningGenomics
Read explanation

Category

Robotics(11 papers)

arXivSep 10

Memory as Plans: World-Action Modeling with Memory-Grounded Planning

Sizhe Zhao +7 more

Robotics
Read explanation
arXivSep 7

Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy

Ayoub Kirouane +2 more

RoboticsArtificial Intelligence
Read explanation
arXivSep 8

TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

Anqi Li +6 more

RoboticsArtificial Intelligence
Read explanation
arXivSep 4

RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?

Zhenxuan Fan +11 more

RoboticsArtificial IntelligenceComputer Vision and Pattern Recognition
Read explanation
arXivSep 7

CosmoH2G: A Hand-to-Gripper Transfer Dataset and Baseline Method for Object Manipulation with Complex Spatial Movements

Hongxiang Zhao +5 more

RoboticsComputer Vision and Pattern Recognition
Read explanation
arXivSep 4

GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

AgiBot Research Team +44 more

RoboticsComputer Vision and Pattern Recognition
Read explanation
arXivSep 7

OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

Yuran Wang +23 more

Robotics
Read explanation
arXivSep 1

EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents

Wei Wang +16 more

RoboticsArtificial Intelligence
Read explanation
arXivAug 25

Latent Action as Intention Enables Efficient Future Imagination for World Action Models

Xiang Li +12 more

Robotics
Read explanation
arXivAug 16

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

GigaBrain Team +58 more

Robotics
Read explanation
arXivAug 23

WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning

Chunkai Yang +2 more

Robotics
Read explanation

Category

Computation and Language(10 papers)

arXivSep 10

Negative Self-Distillation: Learning to Reason by Avoiding Flaws

Rongcan Pei +5 more

Computation and LanguageMachine Learning
Read explanation
arXivSep 9

NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction

NCP Team +27 more

Computation and Language
Read explanation
arXivSep 4

Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs

Seogyeong Jeong +5 more

Computation and Language
Read explanation
arXivSep 5

Steering Geometry: Validating Human Value Geometry in LLM Steering Space

Mohammad Mahdi Abootorabi +7 more

Computation and LanguageArtificial IntelligenceMachine Learning
Read explanation
arXivSep 8

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness

NeoHorse Team +36 more

Computation and Language
Read explanation
arXivSep 3

What Else Needs Fixing? Exploring Cost-Effective Test-Time Compute for Revision Propagation in Artifacts Generated Through Conversation

Daisuke Kikuta

Computation and LanguageMachine Learning
Read explanation
arXivSep 2

Unifying Conformal Language Tasks with In-Context Ensembles

Xiao Shi Huang +4 more

Computation and LanguageMachine LearningMachine Learning
Read explanation
arXivSep 3

Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal

Alejo López-Ávila +4 more

Computation and Language
Read explanation
arXivSep 1

Enoki: Efficient Multi-Level Hallucination Detection

Elisei Rykov +7 more

Computation and Language
Read explanation
arXivAug 23

Length-Adaptive Decoding for Masked Diffusion Machine Translation

Yan Zhan +3 more

Computation and LanguageArtificial IntelligenceMachine Learning
Read explanation

Category

Sound(3 papers)

Category

Cryptography and Security(3 papers)

Category

Audio and Speech Processing(2 papers)

Category

Optimization and Control(1 paper)

Category

Software Engineering(1 paper)

Category

Information Retrieval(1 paper)