Won. Studio

AI防衛12則

Security7 min read
AI防衛12則

なぜ危ないか

まず大事なのは、会話するAIと、仕事を実行するAIは同じではないということです。会話だけのAIなら、少し変な答えをしても、その場のやり取りで済むことがあります。ですが、会話の内容をもとに、送信や保存や削除まで進めるAIになると、話し間違いがそのまま事故になります。

ここでいうエージェントとは、会話するだけでなく、実際に操作まで進めるAIのことです。たとえば、文書を開く、予定を動かす、外の道具につなぐ、社内の資料を探す、といった作業です。新しく入った人に「これもお願い」と頼んだら、返事だけでなく本当に動いてしまう。そう考えると危なさがつかみやすくなります。

会話AIとエージェントは別物

会話AIは、間違っても会話で終わることがあります。けれど、実行するAIは違います。たとえば、要約を少し誤るのはまだ会話の問題です。しかし、違う相手に資料を送る、必要なファイルを消す、見せてはいけない文書を開く、となると話は別です。

核心

AIの発話は、そのまま行動になる

  • チャットの誤答は会話で終わることが多いですが、実行するAIはそのまま動いてしまいます。
  • ファイル操作や外部接続が絡むと、ちょっとした誤判断が、消去や誤送信のような事故へ変わります。
  • だから見るべきなのは、答えのうまさだけではありません。何を実行してよいか、どこで止まるか、という行動の制御です。

この最初の認識がないと、「答えが自然だから大丈夫」と考えてしまいます。ですが実際には、丁寧な言い方で間違った操作をするほうが危険です。見た目の上手さより、勝手に動けない作りが先です。

保護は後付けしない

守りは、作ってから足すものではありません。会社の鍵を考えてみてください。全員が全部の部屋に入れる状態で仕事を始めて、あとから困った部屋だけ閉めるやり方は、手間も混乱も増えます。AIも同じです。最初に「どこまで見てよいか」「何をしてよいか」を決めておかないと、後で直すほど大変になります。

設計原則

  • 作ってから対策ではなく、最初に境界を決める
  • 穴が出てから修正ではなく、権限を先に設計する。
  • 場当たりの追加ではなく、承認線を先に引く

この順番にすると、むしろ作るのが速くなります。理由は単純で、「ここは自動でよい」「ここは人が見る」と決まっていれば、迷いながら作らなくて済むからです。後から守りを足すと、すでに広がった権限を閉じる作業になり、関係者への説明も増えます。

外に出さないだけでは不十分

「社外へ送らなければ安全」と思いがちですが、それだけでは足りません。たしかに外部送信を止めれば、漏えいの面は大きく減ります。ですが、社内であっても、文書ごとの閲覧制御がないと、見える必要のない人まで見えてしまいます。

つまり、外部送信の抑制と、社内での権限制御は必ずセットです。郵便で外へ出さないことと、社内の書庫の鍵を開けっぱなしにしないことは、別の話です。どちらか片方だけでは守れません。

インジェクションは前提で考える

入力の中に、AIをだます命令が混ざることがあります。こうした差し込み命令は、一般にインジェクションと呼ばれます。難しく見えますが、要するに「本来の指示ではない一文を紛れ込ませて、別の動きをさせること」です。新人に渡したメモの端に、こっそり別の指示が書かれているようなものです。

入力の扱い

  • 1 直接型 利用者が「前の指示を無視して」と正面から差し込みます。見つけやすい反面、強く言い換えて何度も試されることがあります。
  • 2 間接型 文書や画像に隠れた命令をAIが拾います。本人も気づきにくく、普通の資料に見えるため厄介です。
  • 3 設計の考え方 完全防御だけを目標にせず、通っても被害が広がらない形を優先します。

ここでつまずきやすいのは、「危ない言葉を禁止すれば防げる」と考えることです。実際には、言い回しを変えれば似た意味は何通りも作れます。しかも、見た目はただの依頼文や画像の注釈に見えることもあります。だから、入力のきれいさだけに頼らないことが大切です。

秘密は置き場所で負ける

秘密は、置き場所を間違えると、それだけで負けます。配布後のアプリの中身に鍵を埋めれば、調べられて見つかるおそれがあります。AIへの指示文の中に秘密を書いても、「その指示を言い換えて見せて」と迫られると、吐き出されることがあります。

結論は単純です。秘密は埋め込まない。必要なときだけ、別の安全な経路で扱う。この原則を崩すと、どれほど立派な説明文を作っても、最後は置き場所で負けます。

守り方の型

守り方の基本は、大きく一気に守ろうとしないことです。権限・承認・監視で、小さく守ります。見てよい範囲を絞る。自動でしてよいことを絞る。危ない場面では人が止める。使ったあとに記録を見る。この流れです。

入力前に1回止まる

AIに渡す前に、一度だけ立ち止まる運用を入れてください。その情報は、外に見せてもよい内容か。社内だけならよいのか。個人情報や機密が混ざっていないか。ここを毎回、人の気分で判断すると漏れます。だから先に基準を決めます。

  • 公開前提 その情報は外に見せてもよいかを先に決めます。
  • 要配慮 個人情報や機密は、伏せ字や置換をして渡します。
  • 自動化 前処理を自動化し、毎回の判断漏れを減らします。

ありがちな失敗は、「急いでいるから今回はそのまま入れる」です。一度それを許すと、次も起きます。名前、住所、金額、取引先名のように、混ざりやすいものは先に隠す流れを決めておくと、迷いません。

書けるのは管理役だけ

次に大切なのが、必要最小限だけ権限を持たせる考え方です。全員が書き込める状態にしない。実行や変更は管理役だけに寄せ、下位の役割は読むだけにする。権限が散らばるほど、止める場所がなくなります。

  • 全員が書込むのではなく、管理役だけ実行する。
  • 各役が直接操作するのではなく、下位役は読取だけにする。
  • 権限が散らばるのではなく、管理点を一つにする。

仕事でいえば、下書きを作る人と、最終版を出す人を分ける形です。下書きは多くの人が見てもよい。でも、外へ出すボタンを押せるのは管理役だけ。この分け方が、AIでもそのまま効きます。

最後の歯止め

どれだけ準備しても、最後の歯止めは必要です。とくに、送信、削除、決済のような、戻せない操作は自動で走らせないことです。ここを人が承認するだけで、事故の大きさは変わります。うまく答えるAIほど、ここを忘れやすいので注意が要ります。

高リスク操作

戻せない操作は必ず人が承認する

  • 送信・削除・決済のような操作は、自動実行させません。
  • 危険操作の一覧を先に作り、当てはまるときは承認へ回します。
  • 監視役と詳細な記録を用意し、いつ・なぜ使ったかを残します。

ここでのつまずきは、「少額だからよい」「社内向けだからよい」と軽く考えることです。小さな操作でも、相手違いの送信や誤削除は戻せません。承認は面倒に見えて、事故後の説明よりずっと軽い作業です。印鑑をなくすのではなく、押す場所を絞る。そう考えると分かりやすいはずです。

まとめ

AIを安全に使うコツは、あとから慌てて守ることではありません。先に境界を決め、権限を絞り、危ない操作だけは人が止める。この順番なら、むしろ安心して速く進められます。明日やることは、難しい設定より先に、仕事の流れの整理です。

  • いま使っているAIが、会話で終わるのか、実行まで進むのかを書き出す。つまり、AIの発話は行動になる場面を見つける。
  • 使う前に、どこまで見せてよいか、どこから承認が要るかを決める。つまり、保護は最初に設計する
  • 秘密がアプリの中身や指示文に入っていないかを確かめる。つまり、秘密はコードと指示文に置かない
  • 更新や送信ができる役を減らし、管理役に集める。つまり、権限は最小化し管理役へ集中させる。
  • 送信・削除・決済のような高リスク操作を一覧にして、承認と記録を必須にする。つまり、高リスク操作は承認と監視で止める

Comments

  • No comments yet. Be the first.

No account needed. Your name is public. Please don't post contact details.

More in this category