t>

米Anthropicは6月11日(現地時間)、同社が先ごろ公開した最上位AIモデル「Claude Fable 5」に組み込んだ保護機能(セーフガード)の一部について、ユーザーから見える形に変更すると発表した。あわせて、これまで特定の保護機能を不可視のまま動作させていたことを「誤った判断だった」と認め、謝罪した。この発表は、SNS上で起きていた批判を踏まえた方針転換といえる。
Fable 5は6月9日に一般公開されたモデルで、サイバーセキュリティ、生物・化学、そしてモデルの「蒸留」(distillation)に関わるリクエストを検知した場合、応答を下位モデルの「Claude Opus 4.8」に自動的に切り替える仕組みを備えている。このうちサイバーセキュリティと生物・化学の分野では、モデルが切り替わったことがユーザーに明示されていた。ところが、蒸留分野の保護機能だけは「不可視」のままで、ユーザーが気づかないうちに挙動が変わっていたという。
今回の変更により、蒸留分野でフラグが立ったリクエストも、他の二分野と同様に、目に見える形でOpus 4.8へ切り替わるようになる。ユーザーは切り替えが発生するたびにその事実を確認できる。API経由の場合は、拒否の理由が返される仕組みに変わる。さらに、サーバサイドでのフォールバック機能も数日以内に提供する予定だとしている。
Anthropicは、当初これらの保護機能を不可視にした理由について、「可視のセーフガードは外部から探られやすいため堅牢である必要があり、作り込みに時間がかかる。一方、不可視のセーフガードはより狭い範囲を対象にでき、誤検知をほとんど発生させずに素早く展開できる」と説明する。Fable 5を迅速かつ安全にユーザーへ届けるため、後者を選んだという。だが同社は「それは誤ったトレードオフだった」「ユーザーは、どのような保護機能がなぜ設けられているのかを把握できるべきだった」と述べ、「バランスを正しく取れなかったことをお詫びする」と謝罪した。
ただし、保護機能を可視化すると、悪意あるユーザーが「ジェイルブレイク」の手がかりを得やすくなるというジレンマもある。そのため堅牢性を維持するには、分類器(classifier)を改良している間、無害なリクエストが誤って引っかかる「誤検知」が増える可能性があるという。Anthropicはサイバーセキュリティと生物・化学分野の分類器についても、無害なリクエストで作動しにくくなるよう調整を進めており、「この期間をできるだけ短く抑えるよう最善を尽くす」としている。ユーザーは、リクエストが誤ってフラグ付けされたと思われる場合、各プラットフォームから報告できる仕組みも案内した。