2026年5月28日

昨日ちょっと無理したので、今日はその反動が・・・

研究室ミーティング。LLMの知識に一つだけ「嘘」を混ぜるという攻撃。たとえば「エッフェル塔はパリにある」という言葉だけを「エッフェル塔はローマにある」と答えるように改変し、その他には(ほとんど)影響を残さない。これはかなり怖い。

もう一つは一度強化学習で学習したポリシーを、それと同等な決定木に「蒸留」する研究。パラメータが減るだけでなく、決定木になるため解釈性も高くなる。なるほど。

明日の講義の準備。