hccccc01333/dsh-eval
Agent evaluation platform for DeepSeek Harness: benchmark YAML, headless dsh orchestration, trace-based metrics, LLM judge, paired A/B, keyless replay, and cross-harness import.
これは DeepSeek Harness(DSH)プラグインです。当サイトは GitHub README、インストール情報、メンテナンス状況、公開セキュリティシグナルをまとめています。
dsh-eval(独立仓库)
独立开发目录:Agent Evaluation Platform 插件 dsh-eval,与
deepseek-harness 主仓的 WIP 隔离。
结构:
packages/eval/—— 插件本体(bundle + CLI app)。harness/—— 指向本地 deepseek-harness 检出的 junction/symlink;pnpm workspace 通过它解析@deepseek-ai/*源码包(0.1.0-rc.5);npm 发布版则对齐 官方0.1.0-rc.6peer 依赖,可直接安装。
快速开始(npm 直装):
pnpm add dsh-eval
dsh plugin --profile eval add dsh-eval
源码流程:
git clone https://github.com/hccccc01333/dsh-eval.git
cd dsh-eval
New-Item -ItemType Junction -Path harness -Target D:\path\to\deepseek-harness
pnpm install
当前能力(v0.2):
dsh eval run benchmark.yaml—— benchmark 编排 + 自动指标 + 脚本化评分 (expected.tool工具选择准确率、expected.check任务成功)。- LLM judge:
judge配置驱动最终答案得分与幻觉标记。 - 子 agent trace 归并:子 session 日志合并进 trial 指标。
- 配对 A/B:同 case 的 win/lose/tie 统计。
- keyless replay:有 key 录一次,CI 里从录制日志免 key 复现。
- 跨 harness 导入:
dsh eval import codex|claude-code <log> --out run.json。 dsh eval report run.json—— markdown 报告,含评分列与聚合比率。dsh eval compare run-v1.json run-v2.json—— 双 run 对比表,带B - A差值。
常用命令(在 D:\dsh-eval 下):
pnpm install
pnpm --filter dsh-eval test
pnpm --filter dsh-eval run typecheck
pnpm --filter dsh-eval build
セキュリティとインストールエビデンス
このスコアは公開リポジトリメタデータと当サイトに登録されたインストールエビデンスのみに基づくもので、コードセキュリティ監査とは異なります。
出所の追跡可能性
公開プラグインカタログから取得し、公開 GitHub リポジトリにリンクしています。
ライセンス
リポジトリは MIT ライセンスを宣言しています。
メンテナンス活動
過去180日以内にコードの更新があります。
インストールエビデンス
再現可能な正確なインストールメタデータはまだ登録されていません。リポジトリの説明に従って手動で確認してください。
インストールライフサイクルスクリプト
確認したパッケージメタデータにインストールライフサイクルスクリプトは宣言されていません。