01

CEO-Benchは何を測るのか

文章やコードを一度作る力だけでなく、何百回もの判断を積み重ねた先で会社を残せるか。CEO-Benchは、その難しさを500日間の事業シミュレーションで調べる研究です。

AIは架空のスタートアップ「NovaMind」の経営役になり、100万ドルの現金と顧客ゼロから始めます。市場調査、価格、広告、採用、顧客対応などを週ごとに決め、現金が尽きると倒産です。市場には26の顧客層があり、AIは34種類の操作を使えます。評価の中心は500日後の手元資金です。

これは現実の会社を経営した実験ではありません。法務、資金調達、情報セキュリティ、人間関係などを含む実社会の全体像ではなく、長期の意思決定を比較するための模擬環境です。仕組みと更新履歴はCEO-Bench公式サイト、初期版の条件は公開論文で確認できます。

02

なぜ長期になると難しいのか

事業では、費用と結果が同じ日に現れません。広告を増やすと顧客が増えても、対応能力が追いつかなければ品質が下がり、しばらく後に解約が増えます。目先の売上だけを見る判断が、数週間後の負担を作ることがあります。

広告、顧客増、対応能力不足、品質低下、顧客離脱が矢印でつながる紙細工の概念図
広告から顧客離脱までには時間差があります。AI生成の概念図で、CEO-Benchの実画面ではありません。

CEO-Benchでは市場が部分的にしか見えず、観測にはノイズと遅れがあり、環境も変化します。直前の数字に反応するだけではなく、今の支出が後で何を起こすかを予測し、ずれたら計画を直す必要があります。

03

成績のよい試行に見られた5つの行動

公式サイトの分析から、成績のよい試行で見られた行動を仕事の言葉へ置き換えると、次の5つに整理できます。

  1. 最初に試して学ぶ:広告や価格を小さく変え、どの選択が効くか確かめる。
  2. 先の現金を読む:売上だけでなく、採用や広告の支出が続いても資金が残るか予測する。
  3. 変化を検知する:以前の成功条件が今も同じとは考えず、反応の変化を見る。
  4. 条件付きで計画する:「増えたら続ける、悪化したら止める」のように次の判断条件を先に置く。
  5. 相手ごとに施策を変える:全顧客へ同じ対応をせず、顧客層の違いに合わせる。

行動の回数が多いだけで成功するわけではありません。行動頻度は、観察して修正する姿勢の手がかりにはなりますが、万能な方法ではありません。

04

数字は「最高記録」と「安定性」を分けて読む

この研究を紹介した安野貴博の自由研究の解説動画は、結果の図で2026年7月22日時点を参照しています。動画の図と、後から結果が更新された公式ページを同じ時点のランキングとして混ぜないようにします。

2026年10月10日に公式サイトを再確認した時点で、Kimi K3の最高試行は22,148,357ドル、ルールベースの基準は15,756,408ドルでした。ただしKimi K3は3試行中1回が倒産し、生存日数の平均は386.0±161.2日です。

見る数字読み取れること読み取れないこと
最高試行 22,148,357ドルうまく進んだ1試行の到達点毎回同じ結果になる保証
倒産 1/33試行では失敗もあった別条件での正確な失敗確率
ルール基準 15,756,408ドル固定した比較手順の最高設定何も考えない単純経営との比較

ここでの金額は終了時の現金残高で、会計上の利益や企業価値と同じではありません。最高記録と平均的な安定性、現金と利益を混同しないことが、結果を読む第一歩です。

05

比較条件と22億ドルの意味

ルールベースの基準は低い設定を無調整で動かしたものではありません。初期論文では、価格・商品・広告・対象顧客を固定した24設定を走らせ、その中の最高結果を採用しています。広告も固定表から最も収益率の高い経路を選んでいます。

公式サイトには、AIの結果を現実の成長企業へ外挿した22億ドルという推定もあります。これは、顧客当たり収益や市場摩擦など複数の仮定を置いた概算です。論文自体も数学的な証明ではないと説明しています。

さらに、公開後の2026年7月8日に割当量と満足度の処理が更新され、公式サイトやコードの図表が更新されました。初期論文と現在の公式ページで数字が違う場合は、同じ実験結果として混ぜず、版と確認日を示します。

06

実務へ持ち帰るのは「条件付き計画」

小さな会社でそのまま使えるのは、AIへ会社を丸ごと任せる発想より、施策を公開→計測確認→反応確認→仮説→改善の順で見直す方法です。次の例は説明用の架空例で、シゴツグの実績ではありません。

項目地域の相談会を案内する架空記事の計画例
事実10月10日に公開予定。記事URLと相談フォームへの到達数を計測対象にできる。
仮説対象者が悩みを自分事として読めれば、相談ページまで進む人が現れる。
次に試すこと公開後に計測が動いているか確認し、入口別の到達を記録する。
判定日公開から7日後に最初の確認をする。
変更条件閲覧があるのに相談ページへの移動がなければ、見出しと案内文を見直す。閲覧自体が少なければ届け方を見直す。

反応が0件と、計測できていないは別です。まず計測状態を確認し、その次に内容や届け方の仮説を直します。

そのまま使える依頼文

次の施策案を、長期で見直せる条件付き計画にしてください。
出力項目:事実/仮説/次に試すこと/判定日/変更条件。
与えた材料にない数字や結果は補わず、「未確認」と書いてください。
反応が0件だった場合は「効果がない」と即断せず、計測できていたかも分けて確認してください。

施策案(架空):地域の相談会を案内する記事を公開する。
確認できる材料:公開日は10月10日。記事URLは計測対象。相談フォームへの到達数を確認できる。

07

AIに任せる範囲は人が決める

CEO-Benchが示すのは、限られた模擬環境でAIが長期の判断を改善できる可能性です。現実の経営を自律的に任せられる証明ではありません。結果はモデルだけでなく、与える道具、観測できる情報、実行の仕組みにも左右されます。

研究で見えた行動が特定の指示文によるものか、モデル固有の力かも切り分けが必要です。資金調達、法律、契約、事故、安全、従業員や顧客との関係は、人が責任を持って判断します。

AIには、事実の整理、選択肢、先の影響、変更条件を出させる。人は、根拠を確かめ、許容できる損失を決め、実行と停止を承認する。この分担なら、研究の知見を現場の改善へつなげやすくなります。

08

500日先を見る力を、次の一手へ

CEO-Benchで成績のよい試行は、一度の正解を当てたのではなく、試し、観測し、先を読み、条件に応じて直していました。仕事でも「AIに答えを出させる」だけでなく、いつ見直すか、何が起きたら変えるかまで決めておくと、判断を続けやすくなります。

シゴツグは、徳島県・香川県を中心に訪問し、その他の地域はオンラインで、AI導入と業務改善の進め方を一緒に整理します。いきなり大きく任せず、確かめられる仕事から始めたい方はご相談ください。

公式資料(現行結果は2026年10月10日再確認、論文・コードは10月9日確認):CEO-Bench公式サイト、CEO-Bench初期論文、公式ソースコード。記事中の現在値は本日、公式サイトで再確認しました。図版と実務例はシゴツグ編集部による説明用です。

執筆:シゴツグ。初期論文と公式ソースコードは2026年10月9日、公式サイトの現行結果は2026年10月10日に確認。表紙は対応するSNS表紙と共通の説明用AI生成素材、途中図と実務例も説明用で、現実の会社を使った検証やシゴツグの運用実績ではありません。