今回は、少し出遅れましたがClaude Opus 5のリリースを起点に、Claude Fable 5と比べて実際に使えるモデルなのかを本音で話しました。ベンチマークはほとんどの項目でFable 5超え、クレーンの鉄球でビルを壊すシミュレーションを作れたのはOpusだけ、という前評判から入っています。
僕が引っかかっているのは、コンテキストウィンドウが逼迫してからの振る舞いです。50万トークンを超えたあたりで、「判断を誤っていました」とオーケストレーター自身が言い出す。阿部さんが挙げたのは、そこではなく調査の詰めの甘さでした。エフォートを上げると逆に品質が落ちるという噂の理由も、意外な角度から出てきます。
話は、自作のメディエーターに作っている見守り機能へ広がります。長時間の実行を見守る監視役を任せるのは、Codexなのか、Opusなのか。レビューを任せると元の方針までガラッと変わるという阿部さんの実感に、スキルづくりだけは任せられないという僕の線引きが並び、結論は宿題として残りました。
終盤は価格の話に移ります。100万トークンあたり入力2ドル・出力10ドルというClaude Sonnet 5の値付けを、OpenRouterの画面でDeepSeek V4 ProやKimi、GPT-5.6 Lunaと見比べました。Sonnetに求めていたものは何だったのかを考え直しています。
【関連リンク】
▼Claude Opus 5 発表(Anthropic)
https://www.anthropic.com/news/claude-opus-5
▼Claude Fable 5 / Mythos 5 発表(Anthropic)
https://www.anthropic.com/news/claude-fable-5-mythos-5
▼Claude Sonnet 5 発表(Anthropic)
https://www.anthropic.com/news/claude-sonnet-5
▼GPT-5.6 Luna(OpenAI 開発者ドキュメント)
https://developers.openai.com/api/docs/models/gpt-5.6-luna
▼OpenRouter
https://openrouter.ai/
▼Codex(OpenAI 公式リポジトリ)
https://github.com/openai/codex
【配信サービス】
▼Spotify
https://open.spotify.com/show/5b4x1u0M2f0Kmr1Xnv1Z7r?si=12580ee9ade0414e
▼Youtube
https://youtube.com/@ai-nichijo-fm
▼Apple Podcasts
https://podcasts.apple.com/jp/podcast/ai%E9%A7%86%E5%8B%95%E9%96%8B%E7%99%BA%E9%83%A8%E3%81%AE%E6%97%A5%E5%B8%B8/id1843990202
▼amazon music
https://music.amazon.co.jp/podcasts/4fd4926b-a654-4dc7-a858-01ff5e0e8c25/ai%E9%A7%86%E5%8B%95%E9%96%8B%E7%99%BA%E9%83%A8%E3%81%AE%E6%97%A5%E5%B8%B8
▼stand.fm
https://stand.fm/channels/68dc82a9036795923c400b4f
▼LISTEN
https://listen.style/p/ai-nichijo-fm?xtIZk9qq