RESEARCH / EVALUATION

把结论留在它的
实验条件里。

研究页不是论文堆栈。每条线索都要问:对照是什么、样本来自哪里、什么没有被测,以及能否迁移到自己的任务。

论文与数据→方法与对照→结果与失败→你的验证集
11

09-23 / 09-24 增量核验的直接研究条目。数字不代表论文质量排序。

4

优先阅读的证据问题:数据、对照、阈值、外推边界。

0

本库不会把作者演示直接升级为通用性能结论。

READ THESE WITH THE METHOD

几条值得沿着证据读的线。

安全 / 评测

JevOut:目标上下文翻转

作者报告定向攻击的上下文翻转结果,并提供代码。读的时候要区分攻击构造、目标任务与防护策略,而不是只看一个百分比。

论文 ↗代码 ↗
法律推断

ContractNLI Jev Benchmark

123 份合同、固定锚点、原始预测和适配器均公开。它描述的是法律文本推断的一个任务,不代表所有合规判断。

论文 ↗复现仓库 ↗
路由

jev-gate 的负结果同样重要

维护者公开的 V4 小任务记录里,默认策略没有触发委派;强制委派同样通过检查却成本更高。失败数据是设计路由策略的材料。

实验记录 ↗

FULL LEDGER

想逐篇核对论文、基准与实验条件?

完整论文清单已迁入网页,可按标题、作者、任务、基准与关键词检索。

打开论文与评测全录 →

YOUR CHECKLIST

任何“更快、更准、更便宜”的截图,都先补齐四件事。

  1. 是否有相同输入、相同预算和合理基线?
  2. 阈值、题目和候选顺序是先固定还是事后调过?
  3. 失败案例、重试、超时与成本是否计入?
  4. 自己的留出集是否复现了同样方向?