MLP の重みを反映した Sparse Autoencoder の初期化手法の提案

Abstract

Sparse Autoencoder (SAE) は LLM 内部の処理を解釈するためのツールとして広く用いられている。しかし、異なる初期値で訓練したSAEでは異なる``特徴’‘が学習されることが報告されている。この問題を解決してSAEの学習を安定化させるためには、SAEの良い初期値を設定する必要がある。本研究ではSAEの初期値としてTransformer層のMLPのデコーダを用いる手法としてSAE-MDを提案する。実験の結果、SAE-MDは既存のSAEと同等の性能を有し、学習の安定性を向上できることを確認した。

Publication
言語処理学会第 32 回年次大会,2026.
北田 俊輔
北田 俊輔
Research Scientist working on Vision & Language with Deep Learning

My research interests include deep learning-based natural language processing, computer vision, medical image processing, and computational advertising.