FlowTune Media

OpenAIが法律専用AIを出した — それでも正答率54%が突きつける「任せきれない」現実

弁護士がAIチャットボットに頼って、存在しない判例を裁判所に提出してしまう——この手の「AIが引用をでっち上げた」事故は、ここ数年、海外の法曹界を何度も騒がせてきた。

2026年9月18日、OpenAIがその問題に正面から取り組む製品を投じた。Astra for Law。法律事務所とリーガルテック企業に向けた、GPT-6 Astraの法律特化構成だ。Hacker Newsでも約580ポイントを集め、「AIは法律実務でどこまで使えるのか」という積年の問いに、また一つ具体的な答えが加わった。

汎用チャットボットとの違いは「専用インデックス」

Astra for Lawの核は、GPT-6 Astraというモデル単体ではなく、それに専用の米国法令検索インデックスを組み合わせた点にある。加えて、法務向けの指示・制御、機密性の高い依頼案件を扱うためのコントロールが用意されている。

汎用のChatGPTに法律を聞くと、モデルは記憶の中からもっともらしい判例名を「生成」してしまう。それが捏造引用の正体だ。Astra for Lawは、専用インデックスという一次情報に近い検索層を挟むことで、この生成任せの構造を減らそうとしている。

数字も出ている。最高の推論設定で比較したとき、Astra for Lawは全体の正答率54.0%を記録した。Web検索のみのGPT-6 Astra(38.7%)に対して、相対で40%の改善だ。判例中心の問いでは、参照すべき判例を24%多く発見し、正しい判決文から最大54%多くの関連箇所を引き出したという。

だが、ここからが肝心だ

これだけ読むと「ついに法律AIが実用段階か」と思いたくなる。だが、正直に見るべき点が2つある。

1つ目。OpenAI自身が明確に釘を刺している。Astraは引用の存在を検証せず、一次資料も確認しない。生成された引用は、信頼できるリーガルリサーチ基盤で人手により1つずつ検証すべきだ、と。専用インデックスで捏造を「減らす」ことはできても、「なくす」わけではない。この正直さは評価したいが、裏を返せば、弁護士の検証作業そのものは消えないということだ。

2つ目。54%という正答率は、見方を変えれば問題のおよそ半分では合格ラインに届かなかったという意味でもある。前世代からの改善幅は確かに大きい。だが「2回に1回は不正解」の水準を、そのまま準備書面に流し込めるはずがない。結局のところ、権威づけと結論の検証は人間の弁護士に残る。

それでも、使いどころは変わる

厳しい数字を並べたが、Astra for Lawが無意味かというと、そうではない。

リサーチの「最初の一歩」を圧倒的に速くする道具として見れば、価値は明確だ。関連しそうな判例を24%多く拾い、正しい判決文から関連箇所を掘り出してくる。ゼロから調べ始めるのに比べれば、たたき台が一気に立ち上がる。人間はそこから、あやしい引用を潰し、論理を詰める作業に集中できる。AIが下書きを作り、人が検証と判断を担う——この分担がリーガルリサーチでも現実味を帯びてきた、というのが今回の本質だろう。

日本の法務に直接使えるわけではない点にも触れておきたい。Astra for Lawが抱えるのは米国の法令検索インデックスであり、日本法をカバーするものではない。ただ、「汎用モデル+専用の一次情報インデックス+厳格な検証前提」という設計思想そのものは、いずれ日本のリーガルテックが追随していく型になりうる。国内でこの構図の製品が出てきたとき、真っ先に評価すべきは、まさに今回の「捏造をどこまで減らせたか」と「検証をどこまで人間に残すか」の2点だ。

製品の詳細はOpenAIの公式ページで確認できる。派手な万能宣言ではなく、限界を自分から明示したうえで踏み込んできたこと——そこにこの製品の、そして2026年のAI×法律の、現在地がよく表れている。

関連記事