GPT-only 数据工作流
批量数据清洗:先定结构,再按批跑
摘要、分类、字段提取这三类任务输入结构相近、单条独立,适合按批推进。先用 20 到 50 条真实样本把输出格式钉死,再放量;格式不合格的条目进重跑队列,不要整批推倒重来。
协议是 OpenAI 兼容,Base URL 为 https://gptbatchlab.site/v1。本站不提供 Claude / Anthropic 入口。
三种常见清洗任务
批量摘要
工单、评论、会话、长文档按批生成摘要。单条互不依赖,失败几条补跑即可。先固定摘要长度和必须保留的字段。
批量分类
意图、情感、内容分级这类枚举标签。产物必须落在你规定的标签集合里,批次结束后做一次标签分布校验。
字段提取
从非结构化文本抽出 JSON 或表格字段。对每批产物做 schema 校验,缺字段或类型不对的转入重跑。
推荐顺序
小样本定结构
用真实数据,不要用假例子。把输出 schema、分类枚举、摘要字数上限写进 prompt,并保存为版本号。
按 batch_id 放量
切批调用 /v1/chat/completions。每批记录输入条数、成功数、校验失败数和 token。
校验后再汇总
JSON 解析失败、缺字段、标签不在枚举内,都算失败项。只重跑这些条目。
提取示例(把模型名换成 /v1/models 的真实 ID)
curl https://gptbatchlab.site/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"<从 /v1/models 复制>","messages":[{"role":"user","content":"从下面文本提取 JSON 字段 name, amount, date"}]}'