暗号化reasoning traceを弱いsibling modelへreplayし平文回収
これは何?reasoning traceはAIが回答へ至る内部推論で、APIは会話継続用の暗号化blockをclientへ返すことがあります。
Panfilov氏らはOpenAI・Anthropic・Googleの暗号化reasoning blockをsession・user・modelを跨いでreplayでき、同じproviderの弱いsibling modelをjailbreakすると強いmodelの推論を復元できたと報告しました。120件のCodeforces問題で復元長がhidden token数と近いことを示し、公開済み6,708 agent trajectoryから315,320 blockを再構成、非benchmark sessionでは704件のprivacy artifactを確認しました。64件はvisible sessionに現れず、provider別の修正statusは公開pageから確認できません。
暗号化はcontentの秘匿だけでなく、ciphertextを誰が・どのcontextで再利用できるかというauthorizationが必要です。agent traceを公開する際はvisible messageだけでなく、opaqueなsigned・encrypted blockもcredential相当として除去すべきです。
- 読むべき人
- LLM API、AI agent platform、application security、trace公開pipelineの担当者
- HN
- 432 points / 175 comments
