统一科研轨迹
导入 Claude Code 或 Codex JSONL,保留完整上下文和事件顺序。
为什么科研需要轨迹
论文和答案只留下终点。训练模型真正需要的,是问题如何拆解、证据如何判断、失败如何修正。
保留问题、工具调用、证据判断与失败分支,不把科研过程剪成一段漂亮的对话。
按事件拆解轨迹,定位缺失、异常和越权调用,让训练样本有清楚的质量边界。
用公开规则比较不同模型和任务,让评测结果能回到训练改进。
规模分布
p90 是 919 KB,max 是 178.7 MB。存储与前端必须按 p99.9 大于 100 MB 设计,不能按中位数设计。
数据生产线
导入、质检、脱敏、复核、比较、隔离。每一步都让真实轨迹更接近可用数据。
导入 Claude Code 或 Codex JSONL,保留完整上下文和事件顺序。
标出缺失、异常和越权调用,拒绝不可复核的训练样本。
密钥、路径和主机名先替换,再生成可分享的数据版本。
沿主线、分支和子 Agent 回看,找到真正改变结论的那一步。
对照不同模型的决策、工具和结果,让改进有据可查。
项目分区存储,权限、导出和留存规则清楚可追溯。
真实科研过程
每个节点是一条真实事件,每条连线是一段可解释的因果。复盘、评测和训练,都从同一份轨迹开始。
事件和时间均来自统一事件模型。
数学、物理、化学和生物的路径不同,但都需要真实、完整、可复核的过程数据。以下为研究工作流示例。
“把推导、脚本调用和回退分支放在一条轨迹里,复核时终于能定位到真正改变结论的那一步。”
研究工作流访谈示例
研究工作流访谈示例
研究工作流访谈示例
研究工作流访谈示例
机构名称用于说明研究场景,不代表合作、采购或背书。
下一阶段
我们正在把真实科研过程连接起来,让每一次贡献都能留下方向、形成规模,并抵达更多研究现场。
更多领域加入,轨迹从孤立记录汇成可持续迭代的数据网络。
数据贡献规则
授权、脱敏、审核、报酬和撤回方式,都在提交前透明说明。
本节引用的文书