hccccc01333/dsh-eval
Agent evaluation platform for DeepSeek Harness: benchmark YAML, headless dsh orchestration, trace-based metrics, LLM judge, paired A/B, keyless replay, and cross-harness import.
이것은 DeepSeek Harness(DSH) 플러그인입니다. 이 사이트는 GitHub README, 설치 정보, 유지보수 상태, 공개 보안 시그널을 모아 보여줍니다.
dsh-eval(独立仓库)
独立开发目录:Agent Evaluation Platform 插件 dsh-eval,与
deepseek-harness 主仓的 WIP 隔离。
结构:
packages/eval/—— 插件本体(bundle + CLI app)。harness/—— 指向本地 deepseek-harness 检出的 junction/symlink;pnpm workspace 通过它解析@deepseek-ai/*源码包(0.1.0-rc.5);npm 发布版则对齐 官方0.1.0-rc.6peer 依赖,可直接安装。
快速开始(npm 直装):
pnpm add dsh-eval
dsh plugin --profile eval add dsh-eval
源码流程:
git clone https://github.com/hccccc01333/dsh-eval.git
cd dsh-eval
New-Item -ItemType Junction -Path harness -Target D:\path\to\deepseek-harness
pnpm install
当前能力(v0.2):
dsh eval run benchmark.yaml—— benchmark 编排 + 自动指标 + 脚本化评分 (expected.tool工具选择准确率、expected.check任务成功)。- LLM judge:
judge配置驱动最终答案得分与幻觉标记。 - 子 agent trace 归并:子 session 日志合并进 trial 指标。
- 配对 A/B:同 case 的 win/lose/tie 统计。
- keyless replay:有 key 录一次,CI 里从录制日志免 key 复现。
- 跨 harness 导入:
dsh eval import codex|claude-code <log> --out run.json。 dsh eval report run.json—— markdown 报告,含评分列与聚合比率。dsh eval compare run-v1.json run-v2.json—— 双 run 对比表,带B - A差值。
常用命令(在 D:\dsh-eval 下):
pnpm install
pnpm --filter dsh-eval test
pnpm --filter dsh-eval run typecheck
pnpm --filter dsh-eval build
보안 및 설치 증거
이 점수는 공개 저장소 메타데이터와 이 사이트에 등록된 설치 증거에만 기반하며, 코드 보안 감사와 다릅니다.
출처 추적 가능
공개 플러그인 카탈로그에서 왔으며, 공개 GitHub 저장소로 연결됩니다.
라이선스
저장소가 MIT 라이선스를 선언했습니다.
유지보수 활동
최근 180일 내 코드 업데이트가 있습니다.
설치 증거
재현 가능한 정확한 설치 메타데이터가 아직 등록되지 않았습니다. 저장소 설명에 따라 직접 확인하세요.
설치 라이프사이클 스크립트
검사한 패키지 메타데이터에 설치 라이프사이클 스크립트가 선언되지 않았습니다.