SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization

By Weihan Meng · Paper · cs.CL

Sparse autoencoders (SAEs) are proposed to extract numerous features from large language model (LLM) representations, yet explaining these features still relies primarily on external observation. This reliance leads to superficial explanations inferred from observed model behavio

Cs.cl

View original

HomeResourceLoading…