GPT-only 数据工作流

批量数据清洗:先定结构,再按批跑

摘要、分类、字段提取这三类任务输入结构相近、单条独立,适合按批推进。先用 20 到 50 条真实样本把输出格式钉死,再放量;格式不合格的条目进重跑队列,不要整批推倒重来。

协议是 OpenAI 兼容,Base URL 为 https://gptbatchlab.site/v1。本站不提供 Claude / Anthropic 入口。

三种常见清洗任务

批量摘要

工单、评论、会话、长文档按批生成摘要。单条互不依赖,失败几条补跑即可。先固定摘要长度和必须保留的字段。

批量分类

意图、情感、内容分级这类枚举标签。产物必须落在你规定的标签集合里,批次结束后做一次标签分布校验。

字段提取

从非结构化文本抽出 JSON 或表格字段。对每批产物做 schema 校验,缺字段或类型不对的转入重跑。

推荐顺序

小样本定结构

用真实数据,不要用假例子。把输出 schema、分类枚举、摘要字数上限写进 prompt,并保存为版本号。

按 batch_id 放量

切批调用 /v1/chat/completions。每批记录输入条数、成功数、校验失败数和 token。

校验后再汇总

JSON 解析失败、缺字段、标签不在枚举内,都算失败项。只重跑这些条目。

提取示例(把模型名换成 /v1/models 的真实 ID)

curl https://gptbatchlab.site/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"<从 /v1/models 复制>","messages":[{"role":"user","content":"从下面文本提取 JSON 字段 name, amount, date"}]}'