JSON 信息抽取:先验证字段,再比较速度
能解析为 JSON,不代表字段内容正确。选型测试应覆盖你真正要自动化的材料。
更新日期:2026-09-26
先定义什么叫答对
明确字段与类型;区分当前事实和历史干扰项;缺失值必须为 null,不能猜。多余字段、Markdown 围栏是否允许,也应提前约定。
{
"name": "林桐",
"age": 28,
"city": "杭州",
"email": null
}比较同一批材料
使用相同 Prompt、接入点设置与输出上限。失败尝试保留在分母中,记录整条记录完全正确率、首个正文等待、完整耗时和计费 token。
更快的错误答案,可能需要重试或人工修正。只有测到通过率和真实用量后,才能估算每条可接受结果的成本。
先跑一个可复现案例
从以下资料提取联系信息。只输出一个 JSON 对象,恰好包含 name、age、city、email 四个字段;age 为数字,未提供的 email 为 null。不要 Markdown 或解释。 资料:林桐,28 岁,目前居住在杭州。未提供电子邮件。历史备注提到曾在北京出差,不是现居城市。
这组合成联系人只测试明确字段和缺失值,不能代表噪声 PDF、手写、多语种或你的生产数据分布。