Aug 09, 2026 The Expressive Power of Transformers with Chain of Thought Jul 18, 2026 Blend-ASC — Optimal Self-Consistency via Power-Law Sample Efficiency Jun 08, 2026 Flow Matching — The Simulation-Free Recipe Under Modern Diffusion Dec 11, 2023 Sliced Mutual Information for Memorization and Generalization Dec 11, 2023 When Memorizing Irrelevant Data Becomes Necessary Oct 09, 2023 Auto-Regressive Next-Token Predictors Are Universal Learners Sep 06, 2023 Memorization Without Overfitting in Large Language Models Sep 02, 2023 Scaling Laws for Neural Language Models Jul 27, 2023 Neural Tangent Kernel: Infinite-Width Networks as Kernel Methods Jul 24, 2023 Frequency Effects on Syntactic Rule Learning in Transformers Jul 22, 2023 Emergent Abilities of Large Language Models Jul 09, 2023 Singular Value Representation: A Graph Perspective on Neural Networks Feb 01, 2023 Neural Collapse: Terminal Phase of Deep Network Training