跳到主内容
公开 · 可核验 · 可复现

AI 之家 评测方法论

我们的评分怎么打、测试任务是什么、多久更新一次、是否存在利益关系——全部公开。

01 / 05PROMISE · 可信度承诺

中文搜索里的「AI 工具横评」大量存在厂商投放、固定排名、复制话术。 AI 之家 的方法只有一句话: 不接软文、不卖排名、收钱不改分、方法全公开。

  • 01公开评分维度与权重:每个工具卡展示五维分数,并在本站说明每一项的含义。
  • 02公开测试任务:编辑部使用统一任务集对同类工具进行横向测试,避免「看官网打分」。
  • 03标注核实日期:每个工具卡都记录 lastVerified,超过 180 天未核实的页面会提示「内容可能已过时」。
  • 04利益披露:存在 affiliate、赞助或利益冲突时,在页面明确标注。
02 / 05DIMENSIONS · 五维评分与权重

每个工具都从五个维度打分

单项 1–5 分,综合分 = 五项算术平均,保留一位小数。我们刻意使用等权重,避免任何单一维度被算法放大。

POWER · 能力
复核 2026-08-20

代码生成质量、复杂需求理解、跨文件推理、Debug 定位、Agent 自主完成任务的能力。

判定示例
高分▲给定含 JWT 鉴权的 REST API 需求,首次生成即可运行、覆盖 token 过期等边界、无硬编码密钥。
低分▼只能补全单行、跨文件改动频繁漏文件、把第三方 SDK 版本写错导致编译失败。
高分▲在既有代码库定位到真正的根因文件,改动范围可控、不误伤无关模块。
低分▼靠全局字符串替换「修复」bug,引入新回归且无测试覆盖。
高分▲Agent 模式端到端跑完整条多步骤链路,失败可重试或明确报错。
低分▼每一步都需人工接管,或失败后静默吞错给出错误结论。
复核:AI 之家 主编 · 外部顾问 L下次 2026-11-18
UX · 易用
复核 2026-08-22

上手成本、IDE/界面集成度、交互流畅度、文档质量、错误提示是否清晰。

判定示例
高分▲安装即用,文档有「5 分钟上手」路径,报错给出可点击的修复建议。
低分▼需要手动配 6 个环境变量,报错是裸 stack trace,文档过期两年。
高分▲自然语言指令即可触发工作流,过程可回溯、可中断恢复。
低分▼功能藏在三级菜单,关键操作无快捷键,新手 10 分钟找不到入口。
复核:AI 之家 体验组 · 外部顾问 M下次 2026-11-20
PRICE · 性价比
复核 2026-08-20

免费额度、付费档位合理性、教育/开源优惠、隐藏消费(如按 token 计费)。

判定示例
高分▲免费档可持续日常使用,付费档价格与能力增量匹配,有学生优惠。
低分▼标价低廉但核心能力全锁在按量计费,一次任务账单远超预期。
高分▲定价页清晰列出所有档位与限额,无隐藏条款。
低分▼「免费试用」实为信用卡预授权,退订流程隐蔽。
复核:AI 之家 主编 · 外部顾问 L下次 2026-11-18
CN · 中文支持
复核 2026-08-25

中文 prompt 理解、中文注释/变量名处理、界面本地化、国内访问稳定性、支付方式。

判定示例
高分▲中文需求理解准确,国内访问延迟低,支持微信/支付宝等本土支付。
低分▼中文 prompt 频繁误读,国内直连超时,仅支持境外信用卡。
高分▲界面与文档全中文,中文变量名/注释处理无误。
低分▼中文界面机翻痕迹重,中文代码注释被当作英文解析出错。
复核:AI 之家 本土化组 · 外部顾问 N下次 2026-11-23
STABILITY · 稳定性
复核 2026-08-23

服务可用性、响应速度、版本更新节奏、是否出现过大规模故障或封号事件。

判定示例
高分▲SLA 高、响应稳定、更新有 changelog、故障透明公告。
低分▼频繁 5xx、更新即 breaking change 且无通知、曾有大规模封号。
高分▲限流清晰、超限有友好提示与退避建议。
低分▼静默截断长上下文、偶发数据丢失且无可追溯日志。
复核:AI 之家 运维组 · 外部顾问 M下次 2026-11-21
AVERAGE

综合分

五项算术平均,不四舍五入。它不代表「绝对好坏」,只代表编辑部在统一任务下的相对排序。

03 / 05TASKS · 标准测试任务

三类任务 + 一张权重表,分数怎么来的可追溯

我们不看 Demo,只看在真实仓库 / 真实需求下的表现。每类任务使用同一份 prompt、同一套验收标准、同一份记录字段, 确保横向可比、结果可复现。下方权重表公开了「每一维的分,分别来自哪一项证据」。

任务一:从零实现功能

给定一个明确需求(如「用 Python 实现带 JWT 鉴权的 REST API,包含用户注册/登录/刷新」),评估生成代码的正确性、完整性、边界处理与可维护性。

ACCEPTANCE · 验收标准
  • · 不经人工修改即可运行,主流程跑通
  • · 覆盖至少 2 个边界分支(token 过期、参数缺失)
  • · 不出现硬编码密钥、SQL 字符串拼接等安全反模式
RECORD · 记录项

首次通过率 · 需人工修正行数 · 总耗时

任务二:在既有代码库中改 Bug / 加需求

给定一个真实存在的开源项目片段,要求定位并修复一个非 trivial 的 bug,或跨多个文件添加一个新功能。评估上下文理解、修改范围控制、回归风险。

ACCEPTANCE · 验收标准
  • · 定位到真正的根因文件,而非靠猜或全库替换
  • · 修改文件数不超出预期范围,不误伤无关文件
  • · 既有测试仍通过,或主动声明破坏性改动及迁移方式
RECORD · 记录项

定位耗时 · 实际修改文件数 · 引入回归数

任务三:Agent 工作流编排

针对 Agent 平台,使用自然语言描述一个多步骤任务(如「读取飞书表格 → 生成日报 → 发送到钉钉群」),评估工具调用、错误恢复、可观测性与调试体验。

ACCEPTANCE · 验收标准
  • · 端到端跑完整条链路,中途不人工接管
  • · 注入一次失败(接口超时 / 返回异常),能重试或明确报错
  • · 产出可回溯的步骤日志,便于定位哪一步出错
RECORD · 记录项

端到端成功率 · 平均步数 · 失败恢复情况

WEIGHTS · 五维分数的证据来源与权重(每行合计 100%)
维度任务一从零实现任务二改 Bug任务三Agent 编排独立核查定价/文档/故障史
POWER能力40%40%20%
UX易用20%30%30%20%
PRICE性价比100%
CN中文30%20%20%30%
STABILITY稳定10%20%40%30%

「独立核查」不看跑分,只查可公开验证的事实:官方定价页、免费额度、支付方式、中文界面与文档、公开故障与封号记录。 Agent 类工具不参与任务一 / 任务二的编码测试时,权重按剩余任务等比重分配,并在该工具卡的结论中说明。

REPRODUCIBILITY · 怎么复现我们的结论
  • 固定输入:同一类目下的所有工具使用同一份 prompt 文本,不针对单个工具做提示词调优。
  • 固定环境:同一仓库快照、同一运行时版本、同一档位模型;换档位会单独标注。
  • 固定记录:每类任务的记录项字段名统一(见上),原始结论沉淀为工具卡的 verdict 与五维 score
  • 固定时效:每次核实更新 lastVerified,超过 180 天未核实的页面会提示「内容可能已过时」。
04 / 05PROCESS · 评分与更新流程

分数不是一次性结论,而是持续维护的状态

01 · 入库

编辑部上手使用至少 3 天,填写五维评分、价格、平台、来源等 frontmatter。

02 · 复核

每篇内容至少由两人复核:一人确认评分,一人核对来源链接与价格有效性。

03 · 更新

重大版本/定价变更时立即更新;常规内容每季度回炉,刷新 lastVerified

04 · 公示

每个工具卡展示评分来源与核实日期;本页持续公开方法论的变更历史。

05 / 05DISCLOSURE · 利益披露
Affiliate & 利益冲突说明

关于 affiliate 推荐链接、返佣政策、付费推广标注与编辑利益冲突的完整声明,已独立成页:

查看完整利益声明 →