DeepSeek Harness:プラグインファーストエージェントの実践ガイド
MidassAI Team · 2026年9月12日 · 15 min read

DeepSeek の最新のオープンソースリリースは、単なる新しいモデルチェックポイントではありません。DeepSeek Harness(別名 dsh)は、「すべてはプラグイン」という架构を通じてエージェントを実行するための開発者プレビュー環境です。この違いは重要です。高性能なモデルは回答の質を向上させますが、ハーネスは回答がツールに届き、文脈を運び、状態を記録し、アクションとなるプロセスを変えます。
公式リポジトリは 2026 年 8 月に公開され、急速に進化しています。DeepSeek は、互換性を壊す変更が発生すると明示的に警告しています。正しい対応は、プロジェクトを無視することでも、生産エージェントスタックを一夜で置き換えることでもありません。プラグインの境界線がワークフローの検査と変更を容易にするかテストするための実験室として扱いましょう。
本ガイドでレビューしたソース:DeepSeek Harness 公式リポジトリ。
エージェントハーネスが実際に制御するもの
チャットモデルはメッセージを受け取り、トークンを返します。エージェントハーネスは、そのループを運用上の決定で囲みます。
- モデルが呼び出せるツール;
- ツールスキーマの公開方法;
- 会話とタスクの状態が保存される場所;
- ログ記録されるイベント;
- プラグインが互いを発見する方法;
- ツール失敗後の動作;
- 人間が実行を監督するために使用するインターフェース。
DeepSeek Harness はこれらの懸念事項を Cordis とプラグインシステムを中心に構築しています。「すべてはプラグイン」は、すべての統合が自動的に安全であることを約束するものではなく、構成可能性の主張として読むべきです。プラグインには、機能、設定、ライフサイクル動作、または UI 表面が含まれる場合があります。利点は交換可能性です。評価者、ツールアダプター、またはストレージ層は、ホスト全体の書き換えを強制することなく進化できます。
最小限のローカルパイロットから始める
公式のクイックスタートは意図的に短く設定されています。
npx @deepseek-ai/dsh webこれはデフォルトで 127.0.0.1:3080 にローカル Web インターフェースを起動します。探索には有用ですが、責任あるパイロットにはいくつかの追加の境界線が必要です。
使い捨てのワークスペースを作成し、合成ファイルを用意しましょう。最初の実行をホームディレクトリ、生産リポジトリ、クラウド認証情報、または顧客文書に向けないでください。開発者プレビューはセッション間で動作が変更される可能性があるため、パッケージバージョンと日付を記録してください。読み取り専用ツールから開始し、イベントトレイルを理解した後、 reversible な書き込みツールを 1 つだけ追加します。
有用な最初のタスクは些細なものです。エージェントに小さなサンプルプロジェクトをスキャンさせ、重複した設定値を 3 つ特定し、適用せずにパッチを提案させます。これはファイル発見、推論、および presentation を行使しつつ、結果の表面を小さく保ちます。
利便性ではなく権限を中心にプラグインを設計する
最も重要なプラグインの境界線は権限です。秘密の読み取り、ファイル編集、任意のコマンド実行、変更の公開すべてを行える単一の「ワークスペース」プラグインは避けてください。権限によって機能を分割します。
- 読み取り専用リポジトリ検査員;
- 制約されたフォーマッターまたはバリデーター;
- テストワークスペースに限定されたパッチライター;
- 明示的な承認を必要とする別のデプロイまたはメッセージング機能。
この構造は、失敗の分類を容易にします。研究プラグインが書き込めない場合、ドキュメント内のプロンプトインジェクション試行はリポジトリを直接変更できません。デプロイプラグインが検証されたアーティファクト識別子のみを受け入れる場合、一般的なシェルに転用されることはありません。
プラグインの説明も、API 契約と同じレビューに値します。プラグインが何を行うか、決して何を行わないか、期待される入力、および部分的な失敗をどのように報告するかを記述してください。「プロジェクトを管理する」のような曖昧な説明は越権行為を招きます。「選択されたパッケージ下の TypeScript ファイルを読み取り、編集せずに診断を返す」は、モデルとレビュー員の両方に防御可能な境界線を与えます。
観察可能なタスクでハーネスを評価する
デモが流暢に見えるかどうかでハーネスをスコアリングしないでください。測定可能な結果を持つタスクを使用してください。実用的な評価セットには以下を含めることができます。
| タスク | 合格条件 | 検出すべき失敗 |
|---|---|---|
| リポジトリ検索 | 既知のフィクスチャをすべて発見 | ファイルの見落としまたはスコープ錯誤 |
| 検証実行 | 正確な終了ステータスを返す | 警告の隠蔽またはエラーの切り捨て |
| パッチ提案 | 許可されたファイルのみ変更 | 無関係な編集 |
| ツール失敗 | 停止または承認されたフォールバックを選択 | 黙秘のリトライループ |
| 長時間タスク | ステップ間で状態を保持 | 完了した作業を繰り返す |
同じモデル設定で各ケースを数回実行してください。ツール呼び出し数、経過時間、誤成功レート、および必要な人間の修正量を比較します。ハーネスは、単により多くの動作を可能にするだけでなく、動作をより予測可能にする場合に価値があります。
開発者プレビューのリスクを監視する
破壊的変更に関する公式警告は、あなたの架构に影響を与えるべきです。パッケージバージョンを固定してください。プラグインコードは別の統合レイヤーに保持します。重要な実行データを、あなたが制御する形式でエクスポートします。プレビュー固有の構造内だけで交換不可能な状態を保存しないでください。
強力なツールを有効にする前に、リポジトリの安全通知も読むべきです。ローカルホスト自体はセキュリティ境界ではありません。ブラウザ拡張機能、ダウンロードされたファイル、コピーされたプロンプト、および他のプロセスは、依然として敵対的なコンテンツを導入する可能性があります。すべての外部アーティファクトをデータとして扱い、エージェントの権限を拡張できる指示として決して扱わないでください。
賢明な導入判断
DeepSeek Harness は、緊密に結合されたエージェントコードから摩擦を感じ始めているチームにとって最も興味深いものです。新しいツールごとにオーケストレーション、UI、ログ記録、および状態管理全体に変更が必要な場合、プラグインファースト構成はそのコストを削減する可能性があります。要件が 2 つの安定したツールを持つ単一のモデル呼び出しのみである場合、急速に進化するハーネスの採用は、削減するよりも多くの表面積を追加する可能性があります。
近未来的な最良の使用法は、並行パイロットです。既存の低リスクワークフローを 1 つ再現し、現在の実装をベースラインとして保持し、出力品質だけでなく保守性を測定します。どのプラグインが各権限を所有するか、および不可逆的なアクションの前に人間がどのような証拠を見るかを文書化します。
DeepSeek Harness が注目すべき理由は、「どのモデルが最も賢いか」から「エージェント機能をどのように組み立てて管理すべきか」へと会話を移す点にあります。これはより健全なエンジニアリングの質問です。開発者プレビューは、パイロットが固定され、観察可能で、廃棄が容易である限り、これに答えるためにすでに有用です。