3-Vote Adversarial Verify 结果

执行日期:2026-07-14 方法:对最关键的 3 个 claim,各用 3 个独立 WebFetch 源做交叉验证(节约版 3-vote,不消耗 MiniMax RPM) 诚实声明:本 verify 由 Claude 主体直接执行 WebFetch,而非 spawn 3 个独立 verifier agent。如需最严格 3-vote,需后续 spawn agent 跑(会消耗 MiniMax RPM)


Claim 1:GitHub Spec Kit 仓库指标

原始 claim:“121k stars / 10.7k forks / 1,400 commits / 189 releases / v0.12.13 / MIT / Python 95%“

Vote #SourceURLResult
Vote 1deep-research search agent a3541cea5129ead34(2026-07-13)github.com/github/spec-kit✅ 121k stars / 10.7k forks / v0.12.13 / Python 95% / MIT / 1,400 commits
Vote 2deep-research search agent(原始 search)github.com/github/spec-kit✅ 一致
Vote 3本轮 WebFetch(2026-07-14,实时)github.com/github/spec-kit✅ 121k / 10.7k / v0.12.13(Jul 13, 2026)/ Python 95.0% / Shell 2.6% / PowerShell 2.4% / MIT / 1,400 commits

Verdict:✅ 3/3 PASSED

  • 数据完全一致(三次独立查询结果相同)
  • 结论:GitHub Spec Kit 121k stars 等数据高度可信,适合作为决策依据

Claim 2:AWS Kiro 定价

原始 claim:“Free + Pro 40 + Power $200”

Vote #SourceURLResult
Vote 1deep-research search agent(中文新闻)new.qq.com/rain/a/20251118A0240A00Free + 40 + $200(4 档)
Vote 2deep-research extract agent ad2eb4af972e09de3(英文二手)多个源Free + 40 + $200(4 档)
Vote 3本轮 WebFetch(2026-07-14,kiro.dev/pricing 实时)kiro.dev/pricing⚠️ 5 档!新增 Pro Max $100/月

Verdict:⚠️ PARTIALLY PASSED,重大新发现

  • ✅ 既有 4 档定价与报告一致
  • 新增 Pro Max $100/月(5,000 credits)档位未在 deep-research 中捕获
  • Free tier 是”永久 50 credits/月”而非”1 个月试用”——表述需修正
  • “创业公司可申请最多 1 年免费 Pro+” 未在报告中提及
  • 额外信用 $0.04/credit,GovCloud 高 20%——定价细节缺失
  • 模型支持范围扩大:Sonnet 4.5/4.6 + Opus 4.8——报告只说”Claude Sonnet/Opus 4”已过时

修正清单:已在 report.md §2.3 AWS Kiro 表格中修正以上 5 点。


Claim 3:ChatPRD 定价

原始 claim:“Free 15/月 / Teams $29/月每座 / Enterprise 定制”

Vote #SourceURLResult
Vote 1deep-research search agent(chatprd.ai/pricing)chatprd.ai/pricingFree + Pro 29 + Enterprise
Vote 2deep-research extract agent a617d8bc8b5abe652(primary)chatprd.ai/pricing15 / $29 / 349 / Custom
Vote 3本轮 WebFetch(2026-07-14,实时)chatprd.ai/pricing✅ Free 15/月(29/月每座($349/年)/ Enterprise 定制

Verdict:✅ 3/3 PASSED

  • 定价完全一致
  • 年付价格(349)与月付价格对应一致
  • 结论:ChatPRD 定价数据可信,作为选型依据

附加观察:本轮 WebFetch 显示 ChatPRD 官网 pricing 页未提供具体的 user/founder 数量统计——之前 deep-research 引用的 “100,000+ users, 1,000+ founders” 可能来自其他页面(about / homepage),定价页本身没有这些数字。标注为”厂商自报,但页面来源需进一步核实”


3-Vote Verify 总结

Claim验证结果修正动作
Spec Kit 仓库指标✅ PASSED(3/3)
AWS Kiro 定价⚠️ PARTIALLY PASSED✅ 已修正 5 处(新增 Pro Max 档、修正 Free 描述、补 1 年免费 Pro+、补信用单价、补模型范围)
ChatPRD 定价✅ PASSED(3/3)标注 user/founder 数来源待核实

局限性诚实声明

  1. 本 3-vote 是”WebFetch 3 源”而非”3 个独立 verifier agent”——前者验证源一致性,后者验证推理过程合理性。两者价值不同,本轮节约版只覆盖前者。
  2. 未验证的 claim 仍占大多数——32 个 central claim 中,本轮只 verify 了 3 个最重要的(选型相关)。其余 29 个 claim 仍依赖 deep-research 1-vote verify 的结果。
  3. 未做时间窗口验证——所有 verify 都在 2026-07-14 当天完成,但部分 claim 涉及”2025-11-18 GA”等历史时点,无独立时间序列证据。

建议:下一轮严格 3-vote 怎么跑

如需真正严格的 3-vote(每个 claim 跑 3 个独立 verifier agent),建议:

# 启动参数
- agent_1_prompt: "尝试反驳这个 claim:<CLAIM_TEXT>。寻找逻辑漏洞、源质量问题、量化错误。默认 refuted=true if uncertain。"
- agent_2_prompt: "中立核查这个 claim:<CLAIM_TEXT>。检查源可信度、量化精度、与同主题其他来源的一致性。"
- agent_3_prompt: "作为目标用户评估这个 claim:<CLAIM_TEXT>。问:这条 claim 是否能直接用于我的决策?还需要哪些补充信息?"
 
# 投票规则
- 3 票中 ≥2 票 refuted → 标记为 FAILED,从报告中剔除
- 3 票中 ≥2 票 confirmed → 标记为 PASSED,保留
- 票数分裂 → 标记为 UNCERTAIN,需进一步核查
 
# RPM 控制
- 每次启动 3 个 verifier agent,处理 3-5 个 claim
- 串行启动避免并发堆积(每批 ≤ 3 个 agent)
- 估算 RPM:每个 verifier 2-5 RPM × 3 = 6-15 RPM/批,远低于 200 上限

这样的真正 3-vote 比本轮的”WebFetch 3 源”更严谨,但消耗 RPM 也更多。