09-23 / 09-24 增量核验的直接研究条目。数字不代表论文质量排序。
RESEARCH / EVALUATION
把结论留在它的
实验条件里。
研究页不是论文堆栈。每条线索都要问:对照是什么、样本来自哪里、什么没有被测,以及能否迁移到自己的任务。
论文与数据→方法与对照→结果与失败→你的验证集
优先阅读的证据问题:数据、对照、阈值、外推边界。
本库不会把作者演示直接升级为通用性能结论。
READ THESE WITH THE METHOD
几条值得沿着证据读的线。
JevOut:目标上下文翻转
作者报告定向攻击的上下文翻转结果,并提供代码。读的时候要区分攻击构造、目标任务与防护策略,而不是只看一个百分比。
论文 ↗代码 ↗ContractNLI Jev Benchmark
123 份合同、固定锚点、原始预测和适配器均公开。它描述的是法律文本推断的一个任务,不代表所有合规判断。
论文 ↗复现仓库 ↗jev-gate 的负结果同样重要
维护者公开的 V4 小任务记录里,默认策略没有触发委派;强制委派同样通过检查却成本更高。失败数据是设计路由策略的材料。
实验记录 ↗FULL LEDGER
想逐篇核对论文、基准与实验条件?
完整论文清单已迁入网页,可按标题、作者、任务、基准与关键词检索。
YOUR CHECKLIST
任何“更快、更准、更便宜”的截图,都先补齐四件事。
- 是否有相同输入、相同预算和合理基线?
- 阈值、题目和候选顺序是先固定还是事后调过?
- 失败案例、重试、超时与成本是否计入?
- 自己的留出集是否复现了同样方向?