LongHorizon-Harness — 実行・状態・監査を分けて長時間エージェントを継続
これは何?CodexやClaude Codeの上で、GUIとCLIをまたぐ長時間taskの進捗を検証可能なstateとして保存する実行harnessです。
AMAP-MLが新規公開したLongHorizon-Harnessは、Manager、fresh-contextのExecutor、独立Auditorへ役割を分け、検証を通った結果だけを永続stateへ入れます。作者は同じQwen 3.7 PlusとClaude Codeを使ったWeaveBench、OSWorld 2.0、Terminal-Bench 2.1で改善を報告していますが、第三者評価ではなく、taskと環境で再検証が必要です。MITのv0.1.3で、macOS中心にtestされ、Windows supportは未成熟、実directoryへの作用とcomputer-use pluginのOS権限にも注意が要ります。
長時間エージェントではcontext長より、完了条件、証拠、復旧可能なcheckpointを誰が管理するかが信頼性を左右します。role分離は有用な設計例ですが、author benchmarkとproduction safetyは別に評価すべきです。
- 読むべき人
- agent基盤開発者、computer-use automation担当、長時間taskの評価設計者
- GitHub
- 550 stars / 66 forks