
Apple Machine Learning Research部門の研究者らは、実際のソフトウェア環境を必要とせず、大規模言語モデル上でエージェントを訓練するための合成データを作成する手法を発表しました。従来のこのようなデータの収集プロセスは、実行可能なAPIと現実的な事前入力済みデータベースを備えた完全に実装された環境を通常必要とするため、スケーラビリティにおいて深刻な制約に直面しています。
提案されたソリューションは、リアルタイムで動作するデジタルワールドモデルとして大規模言語モデルを利用します。API仕様のみがあれば、システムは状態を保持しつつ環境内のエージェントの振る舞いを模倣する相互作用の軌跡を生成します。これにより、新しい学習シナリオごとに複雑なインフラストラクチャサポートを作成する段階を回避できます。
このアプローチは、タスクごとにバックエンドのエミュレーションが必要であるというボトルネックを理論上解消します。この手法はインターフェースの説明のみに依存し、生きたシステムとの相互作用の錯覚を作り出すことで、自律型エージェントのトレーニング用データセットの準備を大幅に加速させる可能性があります。
編集部コメント
なぜ重要か
おそらく結果として、テキストベースのAPI仕様を中心にエージェントの学習プロセスが標準化されるでしょう。次に観測可能な信号は、合成データで訓練されたエージェントと実ログで訓練されたエージェントの効率性を比較する出版物の登場です。主な不確実性は、モデルが実システムには転移しないシミュレーションのアーティファクトを学習してしまうリスクです。