跳到主要内容

科研轨迹数据基础设施

把真实科研过程,变成下一代模型的训练数据

科研问题没有标准答案,只有一连串真实判断。LightRay 收集这些过程,整理成可复核、可训练、可评测的轨迹数据。

支持 Claude Code、Codex 原生 JSONL · 研究者可控授权

单条科研轨迹峰值事件
21,517
单个数据包峰值记录
394,231
单条轨迹文件上限
178 MB
01 为什么科研需要轨迹
bench rail

为什么科研需要轨迹

模型要学会科研,先看见科研如何发生。

论文和答案只留下终点。训练模型真正需要的,是问题如何拆解、证据如何判断、失败如何修正。

bundles
414
files
1,701
corpus
2.03 GB
  1. 01真实科研

    保留问题现场

    保留问题、工具调用、证据判断与失败分支,不把科研过程剪成一段漂亮的对话。

  2. 02可复核数据

    让每一步可检查

    按事件拆解轨迹,定位缺失、异常和越权调用,让训练样本有清楚的质量边界。

  3. 03反馈模型

    把数据送回训练

    用公开规则比较不同模型和任务,让评测结果能回到训练改进。

规模分布

p90 是 919 KB,max 是 178.7 MB。存储与前端必须按 p99.9 大于 100 MB 设计,不能按中位数设计。

199x
p90 919 KB
min 267 Bmax 178.7 MB
单文件规模分布(对数轴)
p25 127 KB p50 264 KB p75 458 KB
02
数据生产线

数据生产线

从一段科研过程,到一份可用训练样本。

导入、质检、脱敏、复核、比较、隔离。每一步都让真实轨迹更接近可用数据。

  • 01

    统一科研轨迹

    导入 Claude Code 或 Codex JSONL,保留完整上下文和事件顺序。

  • 02
    auto_qcready

    样本质检

    标出缺失、异常和越权调用,拒绝不可复核的训练样本。

  • 03
    redacted → shareable

    安全脱敏

    密钥、路径和主机名先替换,再生成可分享的数据版本。

  • 04

    回到证据现场

    沿主线、分支和子 Agent 回看,找到真正改变结论的那一步。

  • 05

    比较模型过程

    对照不同模型的决策、工具和结果,让改进有据可查。

  • 06
    projectexportauditttl

    按项目治理

    项目分区存储,权限、导出和留存规则清楚可追溯。

单会话分布:中位数到峰值(424 个主会话全量实测)

单会话分布measured
tool_use 次数3,872
med 7
output tokens5.14M
med 12 K
cache2.43G
med 561 K
分叉点86
med 0
03 真实科研过程
dom + svg

真实科研过程

让模型看见科研的完整路径。

每个节点是一条真实事件,每条连线是一段可解释的因果。复盘、评测和训练,都从同一份轨迹开始。

fork points
max 86
branched
58.3 %
tool_use
max 3,872
  • 0001用户指令1.2 KB
  • 0002规划41 tok
  • 0003读取文件L1-64
  • 0006编辑+2 -1
  • 0014结果end_turn
  • 0005执行命令exit 0
  • 0009子 Agentagent-8f3c
00:0025:3051:0076:30103:22
  • 主线
  • 分支
  • 子 Agent
  • 当前步骤

事件和时间均来自统一事件模型。

研究者正在贡献

把个人经验,变成模型能学习的证据。

数学、物理、化学和生物的路径不同,但都需要真实、完整、可复核的过程数据。以下为研究工作流示例。

把推导、脚本调用和回退分支放在一条轨迹里,复核时终于能定位到真正改变结论的那一步。


数学研究者(匿名)

研究工作流访谈示例


物理研究者(匿名)

研究工作流访谈示例


化学研究者(匿名)

研究工作流访谈示例


生物研究者(匿名)

研究工作流访谈示例

下一阶段

从一条轨迹,走向一个持续生长的网络。

我们正在把真实科研过程连接起来,让每一次贡献都能留下方向、形成规模,并抵达更多研究现场。

真实过程保留问题、工具调用和每一次判断,让科研轨迹保持完整。

从样本,长成基础设施。

更多领域加入,轨迹从孤立记录汇成可持续迭代的数据网络。

全球网络
LIVE2,847 watching
LIVE2,049 watching
LIVE1,571 watching
LIVE1,284 watching
LIVE1,112 watching
LIVE1,009 watching
05
benchmark

数据与评测

训练数据有出处,评测结果才可信。

每个样本都能回到原始轨迹、具体事件和公开规则,帮助团队持续改进模型。

trace id
真实任务轨迹
event seq
逐事件复核
rule id
规则公开可重跑
07 数据贡献规则
clause-backed

数据贡献规则

每一条数据,都先把边界说清楚。

授权、脱敏、审核、报酬和撤回方式,都在提交前透明说明。