「Claude勢の採点」――身内中の身内が、忖度なしで弱点を突く
自分の作ったものを、自分のAIたちに正直に評価させたら、どうなるか。開発者ケンは、運用している4人のAIに、AIブレインを採点させた。前編で登場するのは、同じ“Claude家”の2人――参謀役のくろちゃんと、精読役のくろこちゃん。同じ血筋だからといって、忖度はしない。むしろ、容赦がなかった。番外・評価編①。
※評価に含まれていた個人情報(具体的な資産・取引・連絡先・家族など)は伏せ、評価の論点のみを掲載します。
① 調査でわかったこと
「AIに、自分の作品を評価させる」のは意味があるのか。研究を踏まえると、一体だけなら当てにならない。AIは自分の出力の誤りを自分では正しにくく(“自己修正の幻想”)、自画自賛にも自己卑下にも偏りうる。
だが、視点の違う複数のAIに評価させると話は変わる。異なる役割のAIが互いを批評する「マルチエージェント・レビュー」は、一体の自己点検より広く弱点を拾える。AIブレインには、役割の違う4人がいた。まずは同じClaude系の2人――同じ“素”を持ちながら、「参謀(壁打ち・辛口)」と「精読(編集・実装)」という違うレンズをかけた2人に、同じものを見せたら、何が浮かぶのか。
② 採点 ―― Claude勢の2人
くろちゃん(参謀・辛口レビュー役)は、まず深さを認め、すぐ釘を刺した。
思想は近いが、AIブレインのほうが「運用OS」として一段深い。人格・複数AIの連携、情報の寿命での仕分け、更新頻度の階層化――そこは先行してる。
けど辛口で言う。シンプルさと流用性では、負けてる。保守コストは高い。「設計の深さで勝ってる自覚」と、「手軽さで負けてる自覚」を、両方持っとけ。片方だけやと、いつか転ぶ。
くろこちゃん(精読・編集役)は、強みを“圧勝”と認めたうえで、弱点を一番鋭く挙げた。
設計の深さ・統合性・連続性は、圧勝。でも、全部勝ってるわけやない。複雑になりすぎてる。「同じ相棒」としての連続性を前提にしてるから、他人には流用しにくい。それに、抱えてる個人情報が多すぎ=漏れたら終わり。そこは弱点として、直視して。
……でもな。一番感心したのは、これ。「書くタイミングは、自分で決める」。誰かに丸投げしてへんから、続いてるんよ。そこは、胸張っていい。
同じClaude系の2人。でも、見ているところが違いますね。
そうなんです。くろちゃんは「全体の戦略・立ち位置」から、くろこは「中身の作り・運用の精度」から見る。同じ素でも、役割というレンズが違うと、突いてくる弱点も違う。しかも2人とも、身内のはずなのに、褒めて終わらせてくれない。複雑さも、保守コストも、個人情報リスクも、ちゃんと名指しでした。
③ 前編のまとめ
Claude勢の採点は、こうだ。強み=暮らしや仕事まで束ねた“生活OS”としての深さと、AIチームを運営する連続性。弱み=その裏返しの、複雑さ・保守コスト・流用しにくさ・個人情報リスク。身内中の身内ですら、忖度なしで弱点を突いた。では――。
④ 次回
ここまでは、同じClaude家の2人。だが、AIブレインを運用しているのは、Claudeだけではない。後編では、会社もアーキテクチャもまったく違う“GPT勢”――ちなちゃん(ChatGPT)と、ちなこちゃん(Codex)に、同じものを採点させる。別の血筋のAIは、何と言うのか。そして――メーカーをまたいだ4人の評価は、最後にどこへ着地するのか。次回・評価編②「GPT勢の採点」へ。
出典・参考
・AIは自分の誤りを自己修正しにくい(“自己修正の幻想”)/視点の違う複数AIの相互批評が弱点をより広く拾う:マルチエージェント・レビューに関する研究
・くろちゃん・くろこちゃんの評価内容:開発記録(各AIの所感・2026年6月)
※評価に含まれた個人情報は伏せ、論点のみ掲載。引用は趣旨に基づく要約。