편집자 노트

hccccc01333/dsh-eval

Agent evaluation platform for DeepSeek Harness: benchmark YAML, headless dsh orchestration, trace-based metrics, LLM judge, paired A/B, keyless replay, and cross-harness import.

이것은 DeepSeek Harness(DSH) 플러그인입니다. 이 사이트는 GitHub README, 설치 정보, 유지보수 상태, 공개 보안 시그널을 모아 보여줍니다.

dsh-eval(独立仓库)

独立开发目录:Agent Evaluation Platform 插件 dsh-eval,与 deepseek-harness 主仓的 WIP 隔离。

结构:

  • packages/eval/ —— 插件本体(bundle + CLI app)。
  • harness/ —— 指向本地 deepseek-harness 检出的 junction/symlink;pnpm workspace 通过它解析 @deepseek-ai/* 源码包(0.1.0-rc.5);npm 发布版则对齐 官方 0.1.0-rc.6 peer 依赖,可直接安装。

快速开始(npm 直装):

pnpm add dsh-eval
dsh plugin --profile eval add dsh-eval

源码流程:

git clone https://github.com/hccccc01333/dsh-eval.git
cd dsh-eval
New-Item -ItemType Junction -Path harness -Target D:\path\to\deepseek-harness
pnpm install

当前能力(v0.2):

  • dsh eval run benchmark.yaml —— benchmark 编排 + 自动指标 + 脚本化评分 (expected.tool 工具选择准确率、expected.check 任务成功)。
  • LLM judge:judge 配置驱动最终答案得分与幻觉标记。
  • 子 agent trace 归并:子 session 日志合并进 trial 指标。
  • 配对 A/B:同 case 的 win/lose/tie 统计。
  • keyless replay:有 key 录一次,CI 里从录制日志免 key 复现。
  • 跨 harness 导入:dsh eval import codex|claude-code <log> --out run.json
  • dsh eval report run.json —— markdown 报告,含评分列与聚合比率。
  • dsh eval compare run-v1.json run-v2.json —— 双 run 对比表,带 B - A 差值。

常用命令(在 D:\dsh-eval 下):

pnpm install
pnpm --filter dsh-eval test
pnpm --filter dsh-eval run typecheck
pnpm --filter dsh-eval build
REPOSITORY SIGNALS

보안 및 설치 증거

이 점수는 공개 저장소 메타데이터와 이 사이트에 등록된 설치 증거에만 기반하며, 코드 보안 감사와 다릅니다.

출처 추적 가능

공개 플러그인 카탈로그에서 왔으며, 공개 GitHub 저장소로 연결됩니다.

라이선스

저장소가 MIT 라이선스를 선언했습니다.

유지보수 활동

최근 180일 내 코드 업데이트가 있습니다.

설치 증거

재현 가능한 정확한 설치 메타데이터가 아직 등록되지 않았습니다. 저장소 설명에 따라 직접 확인하세요.

설치 라이프사이클 스크립트

검사한 패키지 메타데이터에 설치 라이프사이클 스크립트가 선언되지 않았습니다.