-
Benchmarking Neural Networks on Formal Language Classes
Alexandra Butoi, Nicola Lorenzon, Selim Jerad, Taiga Someya, Anej Svete, Ryan Cotterell,
Brian DuSell
-
Non-Asymptotic Length Generalization
Thomas Chen, Tengyu Ma, Zhiyuan Li
-
Weighted Automata Learning with a Hard Inductive Bias
Breandan Considine
-
Neural Induction of Finite-State Transducers
Michael Ginn, Alexis Palmer, Mans Hulden
-
On the Learnability of Chain of Thought
Michael Hahn, Oliver Kraus, Yuekun Yao, Yash Sarrof, Alexander Koller
-
Learning Group Word Problems with Neural Networks
Hedayatullah Hakimi
-
Synthesis and Verification of Transformer Programs
Hongjian Jiang, Matthew Hague, Philipp Rümmer, Anthony Widjaja Lin
-
Logics with Neural Network Semantics
Caleb Schultz Kisby
-
C++-RASP: What Languages Can Transformers Length-Generalize at All?
Jiaoda Li, Ryan Cotterell
-
From Complexity to Clarity: A Three-Axis Study of Geometric Dynamics in LLM Hidden Representations
Xiang Li, Luzhe Sun, Matthew Walter, Jiawei Zhou
-
A Recall Tool Makes Linear RNNs Turing-Complete
Yanhong Li, William Merrill
-
Language Generation with Infinite Contamination
Anay Mehrotra, Grigoris Velegkas, Xifan Yu, Felix Zhou
-
The Infinity of Finite Numbers: Superfinite Capabilities in Finite Architectures
Naoki Negishi, Masaya Taniguchi, Keisuke Sakaguchi
-
Phase Transitions in the Learning of Regular Expressions: A Weight-Space Analysis
Prasanth
-
The Counting Power of Transformers
Marco Sälzer, Chris Köcher, Alexander Kozachinskiy, Georg Zetzsche, Anthony Widjaja Lin
-
Exact Expressivity of Unpadded Transformers
Anej Svete, Ashish Sabharwal, William Merrill
-
Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't
Anej Svete, Ashish Sabharwal, William Merrill, Ryan Cotterell
-
Modeling Tool Use in Transformers Via Computation Oracles
Utkarsh Tiwari, Sai Soumya Nalli, Amit Deshpande, Michael Hahn
-
Evaluating Expressivity of Stack-Augmented Transformers across the Chomsky Hierarchy
Shunqi Wang
-
The Transformer Cookbook
Andy Yang, Christopher Watson, Anton Xue, Satwik Bhattamishra, Jose Llarena, William
Merrill, Emile Dos Santos Ferreira, Anej Svete, David Chiang
-
Selective Irregularity in Japanese Verbs as a Formal Probe for Neural Sequence Models
Wen Zhang
-
(R)NNs too expressive? Neural Networks and the Subregular Hierarchy
Alan Zhou, Jane Li
-
On the Interaction Between Data Complexity and Scaling Laws
Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov
-
Edge of Stochastic Stability: Revisiting the Edge of Stability for SGD
Pierfrancesco Beneventano, Arseniy Andreyev
-
Warm Starting State-Space Models with Automata Learning
William Peter Fishell, Sam Kouteili, Mark Paul Santolucito
-
Discovering Interpretable Algorithms by Decompiling Transformers to RASP
Xinting Huang, Aleksandra Bakalova, Satwik Bhattamishra, William Merrill, Michael Hahn
-
Transformers Provably Learn to Internalize Chain-of-Thought
Yixiao Huang, Hanlin Zhu, Zixuan Wang, Jiantao Jiao, Stuart Russell, Somayeh Sojoudi,
Song Mei
-
CLAP: Carathéodory–Laplacian Attention Projection for Geometric Interpretation of Transformer Heads
Neev Justin
-
Autonomous Agents for Novel Architecture Discovery: Evaluating Expressivity, Efficiency, and Complexity
Brian Kitano
-
FOL-Traces: Verified First-Order Logic Reasoning Traces at Scale
Isabelle Lee, Sarah Liaw, Dani Yogatama
-
Can Interpretation Predict Model Behavior on Unseen Data?
Victoria R Li, Jenny Kaufmann, Martin Wattenberg, David Alvarez-Melis, Naomi Saphra
-
Hidden States as States: Discretizing Hidden-State Geometry in LLM Computation
Xiang Li, Luzhe Sun, Matthew Walter, Jiawei Zhou
-
Differentially Private Language Generation in the Limit
Anay Mehrotra, Grigoris Velegkas, Xifan Yu, Felix Zhou
-
Why Are Linear RNNs More Parallelizable?
William Merrill, Hongjian Jiang, Yanhong Li, Anthony Widjaja Lin, Ashish Sabharwal
-
LLM "Autoformalization" for Phonological Rule Induction
Abed Qaddoumi
-
On the Ability of Transformer to Verify Plans
Yash Sarrof, Yupei Du, Katharina Stein, Alexander Koller, Sylvie Thiebaux, Michael Hahn
-
Information Locality as an Inductive Bias for Neural Language Models
Taiga Someya, Anej Svete, Brian DuSell, Timothy J. O'Donnell, Mario Giulianelli,
Ryan Cotterell
-
On the Reasoning Abilities of Masked Diffusion Language Models
Anej Svete, Ashish Sabharwal
-
Positional and Symbolic Attention in Transformers
Felipe Urrutia, Jorge Salas, Alexander Kozachinskiy, Cristian Buc Calderon, Hector
Pasten, Cristobal Rojas
-
Emergence of Deferred Planning in Automata Embeddings for Task-Conditioned Reinforcement Learning
Marcell Vazquez-Chanlatte, Beyazit Yalcinkaya, Sanjit A. Seshia
-
w#w as an Inductive Bias in Pre-pretrained Language Models
Shunjie Wang
-
Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently
Stanley Wei, Juno Kim
-
Length Generalization Bounds for Transformers
Andy Yang, Pascal Bergsträßer, Georg Zetzsche, David Chiang, Anthony Widjaja Lin