Activation Steeringにおける文章崩壊の抑制に向けた初期検討

Abstract

近年、大規模言語モデル(LLM)の出力を望ましい属性へと誘導する手法として、推論時の内部状態に直接介入するActivation Steeringが注目を集めている。既存のASで用いられるステアリングベクトルには、様々な概念が交絡していることが多く、単純なベクトル加算では目的外の内部表現まで過度に改変されてしまい、制御強度を強めると生成文の流暢性が著しく損なわれる課題がある。本研究では、無関係な特徴への干渉を最小化しつつ、トークン位置ごとの強度最適化を組み合わせることで、制御強度を高めても生成文が破綻しない新たな出力制御手法を提案する。本手法を広く利用されている一般的なローカルLLMに適用し、ステアリングの方向と強度の両面を制御することで、強い制御下でも生成文の自然さ・流暢性が維持されることを検証する。

Publication
NLP 若手の会 (YANS) 第 21 回シンポジウム,2026.

本発表は、YANS 2026のスポンサー賞の選考候補となりました。以下は、フューチャー株式会社の参加報告からの引用です。

[S2-P30] Activation Steeringにおける文章崩壊の抑制に向けた初期検討

西山 天、川田 拓朗、北田 俊輔、永井 大地、彌冨 仁(法政大学)

この研究では、LLMの内部状態にベクトルを足し込んで出力を制御するActivation Steeringについて、生成される文章の崩壊を抑える手法を検討しています。

従来手法は1トークンを出力するたびに同じ強さでベクトルを足すため、目的の概念以外の表現にまで影響が及んでしまったり、介入が不要な箇所にまで作用し、無用な反復や意味の破綻した文章を招いてしまいます。この研究では、介入する位置と強度をトークンごとに決める機構と、元の内部状態を極力保ったまま、目的の概念へ変換する機構を組み合わせた手法を提案しており、2つの機構の適用順を誤ると出力が崩壊することも報告されていました。介入の「どこに・どれだけ」と「どう」を分けて整理した枠組みが明快で、参考になる発表だと感じました。

詳細は、フューチャー株式会社の参加報告をご覧ください。

北田 俊輔
北田 俊輔
Research Scientist working on Vision & Language with Deep Learning

My research interests include deep learning-based natural language processing, computer vision, medical image processing, and computational advertising.