00 · まず3分で
答えは、3つの要点でわかる
- 1未公開AI論文2本の中心課題で、エージェントは実装を完了しても著者基準の答えへ届きませんでした。
- 2別研究の37,802案は、人の後続研究より出発論文の近くへ集中しました。
- 3現在の弱点を示しますが、全エージェント・全分野・将来を否定する結果ではありません。
01 · 未完成の実研究を使う
未完成の実研究を使う
未公開NeurIPS投稿2本の中心問いを、6日間と大きな計算資源を与えて解かせ、元著者が評価しました。厳しい一方で標本は非常に小さい試験です。
02 · 実装が最大の壁ではなかった
実装が最大の壁ではなかった
コードと実験は自律実行しましたが、掲載水準の判断、弱い実験の再設計、行き止まりからの撤退、問いの維持に失敗しました。
未完成の実研究を使う
未公開NeurIPS投稿2本の中心問いを、6日間と大きな計算資源を与えて解かせ、元著者が評価しました。厳しい一方で標本は非常に小さい試験です。
2ケース実装が最大の壁ではなかった
コードと実験は自律実行しましたが、掲載水準の判断、弱い実験の再設計、行き止まりからの撤退、問いの維持に失敗しました。
6日探索の広さを別に測る
4枠組み・6モデルが共通論文から37,802案を生成した別プレプリントでは、案が人の後続研究より出発点近くに集中し、新規性は主に既存手法の組合せでした。
37,802案実行と研究方向は別
決められた技術計画を走らせる能力と、価値ある新しい問いを選ぶ能力は違います。現状の足場は前者を増幅しても後者を自動では補いません。
初期証拠03 · 探索の広さを別に測る
探索の広さを別に測る
4枠組み・6モデルが共通論文から37,802案を生成した別プレプリントでは、案が人の後続研究より出発点近くに集中し、新規性は主に既存手法の組合せでした。
04 · 実行と研究方向は別
実行と研究方向は別
決められた技術計画を走らせる能力と、価値ある新しい問いを選ぶ能力は違います。現状の足場は前者を増幅しても後者を自動では補いません。
05 · 判決ではなく基準点
判決ではなく基準点
双方ともプレプリントでAI研究が中心です。自然科学、長期間、別ツール、人との共同作業で再現するまで一般法則にはできません。
06 · 出典と証拠
出典と証拠
主張を、基礎論文・標準文書、または更新記事の一次研究までたどれます。
- 01Can AI agents conduct open-ended AI research? Early evidence from two case studies公開プレプリント ↗
この記事の仕組み・測定事実・確度の境界を支える資料です。
- 02AI Research Agents Narrow Scientific Exploration公開プレプリント ↗
この記事の仕組み・測定事実・確度の境界を支える資料です。
- 03AI isn’t ready to research itself研究機関の解説 ↗
この記事の仕組み・測定事実・確度の境界を支える資料です。
