あらすじ

Litmusが示したのは「同じ入力を渡すだけで、モデルの性格が見える」ということだ。しかもその性格は、公式ベンチマークでは捕捉できないタイプのものだ。 MMLUは知識を測る。HumanEvalはコード生成を測る。Arenaは総合的な「良さ」を測る。だが、「余計なことをしない能力」「仕様を字面レベルで守る能力」「自制して情報を出さない能力」を測るベンチマークは、ほぼ存在しない。 【成分表示】 AI・人間協働:50%:50%(黄金比) 原材料名: 人間の情熱(ベース)、AIの語彙力(トッピング)、共同の試行錯誤(隠し味) 内容量: 今後入荷の予定あり 注意書き: 人間とAIによる共同調理による作品です。人間が味を決め、AIが盛り付けを担当しました。

連載情報

ウェブ小説

配信言語
カクヨム
カクヨム2026/07/28
  • 現在の作品LLMに「小説の設計図」を渡したら、壊れ方でモデルの性格が見えた