編集者注

hccccc01333/dsh-eval

Agent evaluation platform for DeepSeek Harness: benchmark YAML, headless dsh orchestration, trace-based metrics, LLM judge, paired A/B, keyless replay, and cross-harness import.

これは DeepSeek Harness(DSH)プラグインです。当サイトは GitHub README、インストール情報、メンテナンス状況、公開セキュリティシグナルをまとめています。

dsh-eval(独立仓库)

独立开发目录:Agent Evaluation Platform 插件 dsh-eval,与 deepseek-harness 主仓的 WIP 隔离。

结构:

  • packages/eval/ —— 插件本体(bundle + CLI app)。
  • harness/ —— 指向本地 deepseek-harness 检出的 junction/symlink;pnpm workspace 通过它解析 @deepseek-ai/* 源码包(0.1.0-rc.5);npm 发布版则对齐 官方 0.1.0-rc.6 peer 依赖,可直接安装。

快速开始(npm 直装):

pnpm add dsh-eval
dsh plugin --profile eval add dsh-eval

源码流程:

git clone https://github.com/hccccc01333/dsh-eval.git
cd dsh-eval
New-Item -ItemType Junction -Path harness -Target D:\path\to\deepseek-harness
pnpm install

当前能力(v0.2):

  • dsh eval run benchmark.yaml —— benchmark 编排 + 自动指标 + 脚本化评分 (expected.tool 工具选择准确率、expected.check 任务成功)。
  • LLM judge:judge 配置驱动最终答案得分与幻觉标记。
  • 子 agent trace 归并:子 session 日志合并进 trial 指标。
  • 配对 A/B:同 case 的 win/lose/tie 统计。
  • keyless replay:有 key 录一次,CI 里从录制日志免 key 复现。
  • 跨 harness 导入:dsh eval import codex|claude-code <log> --out run.json
  • dsh eval report run.json —— markdown 报告,含评分列与聚合比率。
  • dsh eval compare run-v1.json run-v2.json —— 双 run 对比表,带 B - A 差值。

常用命令(在 D:\dsh-eval 下):

pnpm install
pnpm --filter dsh-eval test
pnpm --filter dsh-eval run typecheck
pnpm --filter dsh-eval build
REPOSITORY SIGNALS

セキュリティとインストールエビデンス

このスコアは公開リポジトリメタデータと当サイトに登録されたインストールエビデンスのみに基づくもので、コードセキュリティ監査とは異なります。

出所の追跡可能性

公開プラグインカタログから取得し、公開 GitHub リポジトリにリンクしています。

ライセンス

リポジトリは MIT ライセンスを宣言しています。

メンテナンス活動

過去180日以内にコードの更新があります。

インストールエビデンス

再現可能な正確なインストールメタデータはまだ登録されていません。リポジトリの説明に従って手動で確認してください。

インストールライフサイクルスクリプト

確認したパッケージメタデータにインストールライフサイクルスクリプトは宣言されていません。