今週の注目OSS

モデルを固定し、コンテキスト・ツール・権限・検証を改善して、組織の判断を次の実行へ累積する
AI AgentHarness Engineering評価開発プロセス

Harness Engineering — エージェントの品質をコンテキストとツールで累積改善する実践集

Ryan Lopopoloによるハーネスエンジニアリングの論考、事例、playbook、eval、参照資料をまとめたリポジトリです。モデルやコーディングエージェントを固定したまま、コンテキストとツール、権限、検証手段、非機能要件を実行環境へ組み込み、失敗や修正から得た判断を次の実行へ残す設計を扱います。AGENTS.mdから関連資料へ誘導でき、リポジトリ自体をエージェント向けコンテキスト束として利用できます。

なぜ重要か

エージェント導入の差がプロンプト技巧から運用設計へ移っています。個別タスクの成功だけでなく、レビュー指摘や失敗を次回の制約と評価へ変換できるかが、長期的な品質と保守性を左右します。

読むべき人
AIエージェント基盤担当、開発生産性チーム、テックリード
GitHub
1511 stars / 135 forks
Apple Silicon上のモデルを、SwiftUIアプリからチャット・配信・監視し、既存エージェントへ接続する
MLXmacOSLocal AIOpenAI互換API

Nativ — Mac上のMLXモデルをチャット、API、監視まで一体運用

Apple Silicon上でMLXモデルを動かすmacOSネイティブアプリです。Hugging Faceキャッシュ内の対応モデルを検出し、ローカルチャット、モデル管理、性能指標とログの確認、OpenAI互換・Anthropic互換APIの提供を一つのSwiftUIアプリにまとめます。CodexやClaude Codeなどをローカルエンドポイントへ接続する導線も備えます。動作要件はApple SiliconとmacOS 26以降です。

なぜ重要か

ローカル推論を試作品から日常運用へ進めるには、API互換性だけでなく、モデル切替、稼働監視、ログ、アクセス保護が必要です。GUIとサーバー運用を統合する構成は、機密コードを外部へ送らない開発環境の評価を始めやすくします。

読むべき人
macOS開発者、ローカルLLM利用者、AI開発ツール担当
GitHub
607 stars / 34 forks
参照画像から仕様を固定し、コード生成・ブラウザ描画・比較レビューを反復してThree.jsモデルへ到達する
Three.js3DAgent SkillVisual Evaluation

img2threejs — 一枚の画像から検証付きでThree.jsモデルをコード生成

参照画像の物体を、メッシュ抽出ではなくプリミティブ、手続き型シェーダー、生成ジオメトリからなるTypeScriptコードとして再構築するエージェントスキルです。事前仕様、段階的な造形、ブラウザ描画、比較画像、視覚レビューをゲートにし、不一致なら仕様またはコードを修正します。完成物はpivot、socket、colliderを含む階層を持ち、アニメーション利用を想定しています。

なぜ重要か

生成AIによる制作を再現可能にするには、最終画像だけでなく、仕様、生成コード、比較結果、合否判定を残す必要があります。段階ゲートと自己修正を組み合わせた構成は、3D以外のエージェント制作パイプラインにも応用できます。

読むべき人
Three.js開発者、ゲーム・WebGL制作者、エージェントスキル設計者
GitHub
1438 stars / 117 forks
秘密文を暗号化し、LLMのtoken選択へ埋め込み、自然な会話文から受信側が復元する実験
SecuritySteganographyLLMPoC

Conversation Steganography — LLMの語句選択へ暗号文を埋め込むPoC

暗号化したメッセージをローカル言語モデルのtoken選択へ符号化し、通常の会話に見える文章として送受信するGo製PoCです。AES-SIV、PBKDF2による鍵導出、メッセージ順序を検出するconversation chainを組み合わせます。作者は教育・研究目的のPoCであり、秘匿通信を検出する研究も進んでいて未解決の問題があると明記しています。

なぜ重要か

生成文は人間に自然に見えても、別の通信路を持つ可能性があります。エージェントの出力監視では、禁止語や暗号文字列の検査だけでなく、モデル選択の統計的偏りや外部との共有状態も脅威モデルへ含める必要があります。

読むべき人
AIセキュリティ研究者、メッセージング基盤担当、モデル監査担当
GitHub
910 stars / 55 forks
Sandbox CRDを中心に、Template・Claim・WarmPoolで状態付きの隔離実行環境を宣言的に供給する
KubernetesSandboxAI AgentInfrastructure

Kubernetes Agent Sandbox — 状態を保つAIエージェント実行環境をCRDで管理

Kubernetes SIG Apps配下で開発される、隔離された状態付きsingleton workload向けのCRDとcontrollerです。Sandboxは安定したhostnameとnetwork identity、再起動をまたぐ永続ストレージ、停止・再開・期限削除を提供します。SandboxTemplate、SandboxClaim、SandboxWarmPoolを使い、同種環境のテンプレート化と事前起動済みpoolからの高速割当にも対応します。

なぜ重要か

長時間動くエージェントには、一時的なcontainerだけでなく、状態保持、再開、寿命管理、迅速な払い出しが必要です。Kubernetesの標準的なcontroller patternへ落とし込むことで、既存のGitOps、監視、policyと統合しやすくなります。

読むべき人
Kubernetes基盤担当、AIエージェント実行基盤担当、SRE
GitHub
3238 stars / 416 forks