今週の注目OSS

Managerが目標を保持し、fresh-context Executorが作業し、独立Auditorの検証を通った結果だけを永続stateへ追加する
AI AgentState ManagementVerificationMIT

LongHorizon-Harness — 実行・状態・監査を分けて長時間エージェントを継続

これは何?CodexやClaude Codeの上で、GUIとCLIをまたぐ長時間taskの進捗を検証可能なstateとして保存する実行harnessです。

AMAP-MLが新規公開したLongHorizon-Harnessは、Manager、fresh-contextのExecutor、独立Auditorへ役割を分け、検証を通った結果だけを永続stateへ入れます。作者は同じQwen 3.7 PlusとClaude Codeを使ったWeaveBench、OSWorld 2.0、Terminal-Bench 2.1で改善を報告していますが、第三者評価ではなく、taskと環境で再検証が必要です。MITのv0.1.3で、macOS中心にtestされ、Windows supportは未成熟、実directoryへの作用とcomputer-use pluginのOS権限にも注意が要ります。

なぜ重要か

長時間エージェントではcontext長より、完了条件、証拠、復旧可能なcheckpointを誰が管理するかが信頼性を左右します。role分離は有用な設計例ですが、author benchmarkとproduction safetyは別に評価すべきです。

読むべき人
agent基盤開発者、computer-use automation担当、長時間taskの評価設計者
GitHub
550 stars / 66 forks
Gitのfromとtoを構文解析し、entry point以下のcallee追加・削除・移動をcall treeとして差分表示する
Code ReviewTree-sitterCall GraphMIT

calldiff — commit間の変更をfunction call treeで比較

これは何?Gitの二つの状態からfunctionの呼び出し関係を構文解析し、追加・削除・移動をtree差分で表示するCLIです。

新規公開されたcalldiffは、Tree-sitterで22言語のsourceを解析し、entry pointごとのcall tree、二点間の経路、JSONなどの構造化結果を出します。行差分に埋もれやすいcall flowの組み替えをreviewする補助線になり、agent skillとMCP登録も備えます。MITでreleaseはまだなく、型解析ではないためdynamic dispatchやruntime解決のcallは追えず、一部grammarは初回利用時にdownloadします。

なぜ重要か

agentが広い範囲を変更すると、line diffだけでは制御flowの意図を確認しづらくなります。syntacticな限界を明示した上でcall graphの変化を別viewにする設計はreviewの検査点を増やします。

読むべき人
code reviewer、coding agent利用者、静的解析tool開発者
GitHub
289 stars / 14 forks
RTT・throughput・lossを測り、BDPとpolicer折れ点から32個のTCP設定と整形値を計算し、変更前snapshotを残す
LinuxTCPBBROperations

tcpfit — RTT・帯域・lossの実測からTCP設定と整形値を導出

これは何?Linux serverで回線を測定し、帯域遅延積とpolicerの折れ点からTCP bufferやoutbound shapingを決める運用toolです。

新規公開のtcpfitは、BBRとfq、buffer、queue、connectionなど32個のsysctlを扱い、固定presetではなくmachineごとのRTT、throughput、lossから設定値を作ります。policerが疑われる場合だけiperf3で折れ点をscanし、初回変更前のsnapshotとrollbackも用意します。MITですがrootでsystemdとnetwork設定を変更し、Linux・systemd・iproute2と近距離のiperf3 peerが必要で、国際経路bottleneckやscan上限の誤判定という既知の限界があります。

なぜ重要か

network tuningはhardware、RTT、帯域制限、workloadで正解が変わります。測定から適用、対象file、rollbackまで一体化した点はdurableですが、変更権限が大きいためstagingと復旧確認が前提です。

読むべき人
Linux運用担当、network engineer、proxy・VPS管理者
GitHub
234 stars / 24 forks
1140億parameterから約60億をactivateし、previewで低解像度生成、refinerで1080p相当へ上げるがHopper GPU 8枚を要する
Video GenerationMixture of ExpertsCUDAApache-2.0

MAGI-2 Preview — 1140億parameterの音声付き動画MoEを2段階推論

これは何?textまたは静止画から、音声と映像を同時に含む10秒videoを生成する大規模Mixture of Experts modelの推論実装です。

Sand.aiが新規公開したMAGI-2 Previewは、総parameter 1140億のうちtokenごとに約60億をactivateし、低解像度previewと1080p相当refinerの二段階で生成します。Apache-2.0のrepositoryはinference codeで、weightは別配布の約307GB、現行base版は100 preview stepと5 refiner stepを要します。実行にはNVIDIA Hopper GPU 8枚が必要で、10秒以外の長さと蒸留版は未提供のため、active parameterの小ささだけで軽量modelとは評価できません。

なぜ重要か

MoEのscaleを実運用へつなぐにはparameter routingだけでなく、checkpoint配置、stage間offload、denoise step、複数GPUを合わせたsystems designが必要です。公開条件はarchitecture上の効率と利用可能性の差を具体化します。

読むべき人
generative video研究者、ML systems engineer、GPU基盤担当
GitHub
438 stars / 11 forks
一命令だけを採点対象にし、CPU内部からPCIe MMIOまでの境界条件を重ねてworst-case latencyを測る
x86MicroarchitectureAssemblyMIT

Assembly Hall of Shame — CPU命令のworst-case latencyを実験で収集

これは何?単一CPU命令を意図的に最も遅くする条件を探し、assembly、測定結果、machine条件を並べるmicroarchitecture実験集です。

新規公開されたAssembly Hall of Shameは、subnormal、entropy枯渇、split lock、MSR、MMIOなどを使ったx86命令の高latency例をMITで収録します。現在の最長例は、AMD Ryzen 7 5800H上でPCIe MMIOを読むfxrstor64へ別coreのtrafficを重ねた、作者環境固有の62秒測定です。一般的なinstruction性能表ではなく、privileged registerやhardware固有addressを扱うentryもあるため、結果の一般化や実機での再現には強い注意が必要です。

なぜ重要か

平均的なbenchmarkだけでは、instructionがdevice、firmware、privilege境界に触れた際のpathologicalな待ちを見落とします。反例集として有益ですが、安全なsandboxとhardware知識なしの実行は避けるべきです。

読むべき人
performance engineer、CPU・OS researcher、低level security担当
GitHub
726 stars / 10 forks