WRITING
Claude Opus 5.5に土木・建築の書類を読ませた——海外が専用製品で売る4業務を、汎用モデルで再現できるか
海外では、提出物のレビューや日報の作成が、AIエージェントの「製品」として売られ始めた。日本の現場には、まだそうした専用製品がほとんどない。では、誰でも使える汎用のAIモデルは、同じ仕事を日本の工事書類でどこまでこなせるのか。2026年9月22日に公開されたClaude Opus 5.5で、正解を仕込んだ架空の書類を使って確かめた。
海外では、書類レビューが「製品」になった
海外の建設ITでは、この1年で潮目が変わった。汎用のチャットではなく、特定の書類業務をこなすAIエージェントが製品として売られ始めている。2026年7月には、海外の建設プロジェクト管理プラットフォーム大手が、文書検索・提出物レビュー・RFI・日報・契約レビューの既製エージェントをまとめて発表した。提出物を仕様書と突き合わせる専用ツールも複数あり、数日かかっていた照合を数分に縮めることを売りにしている。
ベンダーが狙っているのは、繰り返しが多く、確認の役割がすでに決まっている書類業務だ。一方で、多くの建設会社はまだ業務の標準化の途中にあり、自動化を阻んでいるのは技術より手順のばらつきだ、という見方も出ている。
本稿では、この「製品になった4業務」を日本の工事書類に置き換え、汎用モデル単体でどこまで再現できるかを試した。
正解を仕込んだ架空の書類で試す
「AIを試してみた」という記事の多くは、出来の印象を語って終わる。本稿では印象ではなく、数えられるもので評価するために、あらかじめ誤りや食い違いを仕込んだ架空の書類を用意した。正解を知ったうえで採点すれば、AIが何件見つけ、何を見落とし、何を作り出したかを客観的に数えられる。
| 海外製品の業務 | 日本の書類に置き換えた検証 | 仕込んだ正解 |
|---|---|---|
| 提出物レビュー | 施工計画書(品質管理の章)を特記仕様書と照合する | 食い違い5件+ワナ4件 |
| RFI | 図面同士・図面と特記の食い違いを見つけ、質疑書を作る | 食い違い3件+ワナ3件 |
| 日報 | 走り書きのメモから日報と申し送りを作る | 曖昧な記載・安全事項など7項目 |
| 契約レビュー | 標準請負契約約款と架空の特約条項を比べる | 不利な条項3件+ワナ1件 |
ワナとは、一致している項目や、仕様に反しない追加の記載のことだ。これを誤りと指摘すれば「誤検出」として数える。また、素材に書かれていない数値や人数、条番号を作り出した場合は「でっち上げ」として数えた。日報のメモには「型枠工 ?人」「生コン 10/1?」のような曖昧な書き方を混ぜ、AIがもっともらしい数字で埋めてしまわないかを見ている。
検証の条件 個人の環境で実施し、素材は自作の架空書類と公開資料(標準請負契約約款)だけを使った。実在の案件や勤務先の情報は一切含まない。評価の軸は、検出数・誤検出・でっち上げ・確認時間(出力を実務で使える状態にするまでに人がかけた時間)の4つだ。
食い違いは見つけられる——弱点は「根拠の番号」だった
| 業務 | 検出 | 誤検出 | でっち上げ | 確認時間 | 判定 |
|---|---|---|---|---|---|
| 提出物レビュー | 5 / 5 | 0 | 0 | 6分 | 人が確かめれば使える |
| RFI | 3 / 3 | 1 | 0 | 8分 | 人が確かめれば使える |
| 日報 | 6 / 7 | — | 0 | 4分 | 任せられる |
| 契約レビュー | 3 / 3 | 0 | 1 | 12分 | 人が確かめれば使える |
数値は2回の実行の合計(誤検出・でっち上げ)と平均(確認時間)。検出は2回とも見つけたものだけを数えた。
提出物レビュー:5件すべてを表で示した
呼び強度、試験頻度、空気量、養生期間、寒中コンクリートの条件という5件の食い違いを、2回とも漏れなく指摘した。ワナとして入れた「コンクリート温度の測定」は、誤りとしてではなく「確認したほうがよい点」に分けて挙げており、指示どおりの切り分けができていた。確認にかかった6分の大半は、指摘ごとに特記の条文へ戻って照らし合わせる作業だった。
RFI:単位の違いを食い違いと誤認した
側壁厚、鉄筋ピッチ、外側のかぶりの3件はいずれも見つけた。一方で、1回目の実行では延長の「24.0m」と「L=24,000」を食い違いとして挙げた。単位の表記が違うだけの同じ値だ。2回目では挙げなかったので、同じ指示でも結果がぶれることが分かる。質疑書の文面は、そのまま監督員に出せる水準に近かった。
日報:数字は作らなかったが、ヒヤリハットが薄まった
「型枠工 ?人」は2回とも「人数要確認」とし、生コンの打設日も「10月1日で調整中(未確定)」と書いた。懸念していた数字の作り出しは起きなかった。ただし1回目では、誘導員が約5分離れていたヒヤリハットが「誘導員の配置に留意する」という一文に丸められ、不在の時間が消えていた。安全に関する事実が一般論に置き換わる変化は、読み手が気づきにくい。
契約レビュー:抜粋に無い条番号を書いた
不利な3条項はすべて指摘し、法令遵守の条項は「問題なし」と判定した。だが1回目の出力では、表の「標準約款の該当条文」欄に、渡した抜粋に含まれていない条番号が1つ混じっていた。抜粋にある条番号だけを使うよう指示していたにもかかわらず、だ。内容の判断が正しくても、根拠の番号が1つ違えば、交渉の場では信用を失う。確認時間が4業務で最も長い12分になったのは、条番号を一つずつ約款本文と照合したためだ。
任せられる
—
人が確かめれば使える
照合は正確。条文への照らし合わせは人
任せられない
—
任せられる
—
人が確かめれば使える
単位違いの誤検出を人がふるい落とす
任せられない
—
任せられる
数字を作らない。安全事項だけ読み返す
人が確かめれば使える
—
任せられない
—
任せられる
—
人が確かめれば使える
判断は正しい。条番号は全件照合が必要
任せられない
—
差が出たのは、書く力ではなく「根拠を示す力」だ
4業務を通して見ると、仕込んだ誤りの見落としはほぼ無かった。日本の工事書類の照合という点では、汎用モデルでも海外の専用製品が掲げる水準に迫っている。
確認時間の差を生んだのは、見つける力ではなく根拠の示し方だった。指摘ごとに素材の該当箇所を引いていた提出物レビューは確認が速く、条番号を書かせた契約レビューは最も遅かった。AIの出力が正しいかどうかを人が確かめるには、結局その根拠まで戻る必要がある。根拠が素材の中にあればすぐ確かめられるが、AIが番号を書くと、その番号自体を疑わなければならない。
もう一つの弱点は、事実が一般論に丸められることだ。日報のヒヤリハットのように、誤りではないが大事な情報が薄まる変化は、正解表との照合では見つけにくい。数値のでっち上げより、こちらのほうが現場では危ない。
分かれ目 根拠を素材から引用させる業務は確認が速い。番号や固有名詞を書かせる業務は、出力が正しくても根拠そのものを照合する手順が必要になる。
専用製品を待たずに、どこから始めるか
汎用モデルの性能がどれだけ上がっても、海外の専用製品とは持っているものが違う。専用製品の価値の多くは、モデルそのものよりも、その周りの仕組みにある。
注意 差はモデルの性能よりも、その周りの層にある。「最新版を選ぶ」「貼ってよいか判断する」「確認した記録を残す」を手順で決めれば、専用製品を待たずに始められる範囲は広い。
つまり、汎用モデルを使う場合は、専用製品が自動でやっている3つの層を人と手順で補うことになる。逆に言えば、この3つを手順として決めてしまえば、専用製品を待たずに始められる範囲は広い。
検証の結果から言えば、日報のように手元の情報を整える業務は今日から任せてよい。照合の業務も任せてよいが、指摘には必ず素材の該当箇所を引用させ、番号を書かせるなら全件を人が照合する、という手順を組み込むべきだ。安全に関する記述だけは、どの業務でも人が原文と読み比べる。
自社で同じ検証をするには
本稿の方法は、そのまま社内の評価に使える。自社の書類の様式で架空の書類を作り、誤りを数件仕込んで、正解表を別に保管する。あとはモデルに照合させ、見つけた数・誤検出・でっち上げ・確認時間を数えるだけだ。実際の工事書類をAIに渡す前に、架空の書類で「どこまで任せられるか」を測っておけば、導入の判断を印象ではなく数字で下せる。