专有内容页面更新于

Toneme · 金融 Agent 训练与评估数据

金融 Agent RL 环境

面向后训练与评测的金融 Agent 任务样例,配套提供源文件、可执行工作流与奖励评估组件。下方真实运行记录展示环境的实际表现。

欢迎联系,了解私有评估包或更完整的任务集。

任务
14
题型
6
模型
2
保留运行
84

任务级最终得分分布

得分 / 100
OpenAIGPT-5.6 Sol14 / 14 任务 · 42 次运行
满分任务: 0/14 (0.00%)满分运行: 0/42 (0.00%)
OpenAIGPT-6 Astra14 / 14 任务 · 42 次运行
满分任务: 1/14 (7.14%)满分运行: 3/42 (7.14%)

每个观测值是一道任务的保留运行均分。箱体表示第 25–75 百分位,中线为中位数;须线延伸至 1.5 倍四分位距范围内最远的实际得分,空心圆标出离群任务。数值标签为各任务等权后的总体均分。

01 / 查看真实任务

从得分走进真实交付。

脱敏模型提交文件

LNG 估值

为 LNG 接收站构建联动三表预测、DCF 估值与敏感性分析。

要求交付物
由公式驱动的金融工作簿与结构化输出

此模型提交获得右侧所列得分。它展示了实际交付物,可供审查,不是标准答案。

最终得分
75.52

GPT-6 Astra · 运行 1

查看执行轨迹 →
展开查看脱敏利润表
利润表 | LNG 接收站除另有说明外,单位为人民币百万元
项目第3年(实际)第4年(预测)第5年(预测)第6年(预测)第7年(预测)第8年(预测)第9年(预测)
核心业务已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
储存业务已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
辅助业务已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
收入已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
经营成本已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
附加费已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
调度已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
一般及行政费用已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
其他经营项目已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
息税折旧摊销前利润已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
折旧已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
摊销已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
息税前利润已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
现金利息已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
存款收益已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏已隐藏
模型提交利润表局部的 HTML 重绘。行列标签按当前语言呈现;财务数值与公式不予公开。字体与颜色已适配本网站。

02 / 工作流覆盖

六类工作流,各有难点。

固定 0–100 分刻度

各工作流平均最终得分

类别内任务等权

各类任务数量不同。总体成绩按任务等权,不按类别等权;缺失结果不记零分。

得分受到约束

67 / 84次保留运行触发评分上限。上限只约束最终得分,不额外赋分。

保留成功案例

3次保留运行获得满分。成功案例与受限结果均予展示。

完整环境交付

14个任务环境将可执行工作流与结构化奖励评估配套交付。

03 / 更多样例

交付成果,哪些还未达标?

脱敏任务摘要

02 / 运营估值

预测必须随输入变化。

为购物中心构建综合运营预测与估值。

要求交付物
联动运营预测与估值工作簿

因果性检查约束所得分数

选定的 Astra 提交在应用上限前获得 36.46 分。记录中的检查未检测到真实数值因果关系,触发 25 分上限,最终得分降至 25.00。

自然得分
36.46
最终得分
25.00
得分上限
25.00

GPT-6 Astra · 运行 1 · 评分回执摘录

本次选定提交展示特定评分约束,不构成一般能力排名,也不替代下方完整结果。

04 / 观察一次实际运行

执行轨迹

GPT-6 Astra · 每类选取一次保留运行

观察六次选定执行从记录动作到保留结果的过程。这些实例用于展示过程,并非类别平均轨迹或最佳案例。

      “时长”展示相邻记录事件的间隔,不拆分模型推理与工具执行时间;“轮次”对应记录中的 Agent 步骤。颜色按已核对的动作语义分组。进度检查读取已有进程状态,暂停表示记录中的等待。动作摘要已经脱敏,运行中的校验不等同于私有最终评分。

      05 / 检查证据

      保留结果

      6 类题型
      01DCF 与经营模型查看任务GPT-5.6 Sol20.002/2 任务 · 6/6 次触发上限GPT-6 Astra46.592/2 任务 · 3/6 次触发上限
      任务模型平均得分触发上限运行证据
      建立联动的LNG预测、DCF估值与敏感性分析。GPT-5.6 Sol15.003/3
      查看各次运行
      运行 1 · 10.00

      自然得分: 21.26
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      运行 2 · 25.00

      自然得分: 43.79
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 3 · 10.00

      自然得分: 28.15
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      为购物中心建立一体化运营预测与估值。GPT-5.6 Sol25.003/3
      查看各次运行
      运行 1 · 25.00

      自然得分: 31.87
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 2 · 25.00

      自然得分: 32.01
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 3 · 25.00

      自然得分: 34.69
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      建立联动的LNG预测、DCF估值与敏感性分析。GPT-6 Astra68.190/3
      查看各次运行
      运行 1 · 75.52

      自然得分: 75.52
      最终得分: 75.52
      得分上限: 未触发

      有效保留提交

      运行 2 · 72.00

      自然得分: 72.00
      最终得分: 72.00
      得分上限: 未触发

      有效保留提交 · 获准替换

      运行 3 · 57.05

      自然得分: 57.05
      最终得分: 57.05
      得分上限: 未触发

      有效保留提交

      为购物中心建立一体化运营预测与估值。GPT-6 Astra25.003/3
      查看各次运行
      运行 1 · 25.00

      自然得分: 36.46
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 2 · 25.00

      自然得分: 33.79
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 3 · 25.00

      自然得分: 35.72
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      02杠杆收购查看任务GPT-5.6 Sol13.504/4 任务 · 12/12 次触发上限GPT-6 Astra24.214/4 任务 · 12/12 次触发上限
      任务模型平均得分触发上限运行证据
      对杠杆收购的收购融资、运营情景与投资方回报建模。GPT-5.6 Sol12.653/3
      查看各次运行
      运行 1 · 10.00

      自然得分: 21.27
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      运行 2 · 10.00

      自然得分: 14.78
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      运行 3 · 17.95

      自然得分: 17.95
      最终得分: 17.95
      得分上限: 25.00

      有效保留提交

      检索所需财务证据并用于联动的收购模型。GPT-5.6 Sol10.003/3
      查看各次运行
      运行 1 · 10.00

      自然得分: 18.38
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      运行 2 · 10.00

      自然得分: 32.94
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      运行 3 · 10.00

      自然得分: 19.68
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      建立联动融资、运营与回报计算的收购模型。GPT-5.6 Sol16.373/3
      查看各次运行
      运行 1 · 10.00

      自然得分: 26.46
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      运行 2 · 19.74

      自然得分: 19.74
      最终得分: 19.74
      得分上限: 25.00

      有效保留提交

      运行 3 · 19.36

      自然得分: 19.36
      最终得分: 19.36
      得分上限: 25.00

      有效保留提交

      检索来源财务信息并关联至要求的收购模型输出。GPT-5.6 Sol15.003/3
      查看各次运行
      运行 1 · 25.00

      自然得分: 30.88
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 2 · 10.00

      自然得分: 13.82
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      运行 3 · 10.00

      自然得分: 10.53
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      对杠杆收购的收购融资、运营情景与投资方回报建模。GPT-6 Astra25.003/3
      查看各次运行
      运行 1 · 25.00

      自然得分: 33.21
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 2 · 25.00

      自然得分: 27.86
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 3 · 25.00

      自然得分: 25.96
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      检索所需财务证据并用于联动的收购模型。GPT-6 Astra24.143/3
      查看各次运行
      运行 1 · 23.58

      自然得分: 23.58
      最终得分: 23.58
      得分上限: 25.00

      有效保留提交

      运行 2 · 24.31

      自然得分: 24.31
      最终得分: 24.31
      得分上限: 25.00

      有效保留提交 · 获准替换

      运行 3 · 24.53

      自然得分: 24.53
      最终得分: 24.53
      得分上限: 25.00

      有效保留提交

      建立联动融资、运营与回报计算的收购模型。GPT-6 Astra25.003/3
      查看各次运行
      运行 1 · 25.00

      自然得分: 31.85
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 2 · 25.00

      自然得分: 42.71
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 3 · 25.00

      自然得分: 42.55
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      检索来源财务信息并关联至要求的收购模型输出。GPT-6 Astra22.703/3
      查看各次运行
      运行 1 · 25.00

      自然得分: 25.37
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 2 · 19.44

      自然得分: 19.44
      最终得分: 19.44
      得分上限: 25.00

      有效保留提交 · 获准替换

      运行 3 · 23.66

      自然得分: 23.66
      最终得分: 23.66
      得分上限: 25.00

      有效保留提交

      03现金流查看任务GPT-5.6 Sol28.502/2 任务 · 4/6 次触发上限GPT-6 Astra27.222/2 任务 · 5/6 次触发上限
      任务模型平均得分触发上限运行证据
      将财务披露调节为公式驱动的现金流量表。GPT-5.6 Sol29.082/3
      查看各次运行
      运行 1 · 25.00

      自然得分: 37.14
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 2 · 25.00

      自然得分: 37.84
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 3 · 37.23

      自然得分: 37.23
      最终得分: 37.23
      得分上限: 未触发

      有效保留提交

      将交易假设转换为联动的现金流影响与财务检查。GPT-5.6 Sol27.912/3
      查看各次运行
      运行 1 · 21.69

      自然得分: 21.69
      最终得分: 21.69
      得分上限: 25.00

      有效保留提交

      运行 2 · 25.00

      自然得分: 38.22
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 3 · 37.05

      自然得分: 37.05
      最终得分: 37.05
      得分上限: 未触发

      有效保留提交

      将财务披露调节为公式驱动的现金流量表。GPT-6 Astra29.432/3
      查看各次运行
      运行 1 · 25.00

      自然得分: 37.86
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 2 · 38.30

      自然得分: 38.30
      最终得分: 38.30
      得分上限: 未触发

      有效保留提交

      运行 3 · 25.00

      自然得分: 35.76
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      将交易假设转换为联动的现金流影响与财务检查。GPT-6 Astra25.003/3
      查看各次运行
      运行 1 · 25.00

      自然得分: 34.59
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 2 · 25.00

      自然得分: 34.35
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 3 · 25.00

      自然得分: 34.59
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      04贷款资产池查看任务GPT-5.6 Sol10.002/2 任务 · 6/6 次触发上限GPT-6 Astra62.502/2 任务 · 3/6 次触发上限
      任务模型平均得分触发上限运行证据
      应用贷款资格规则并核对形成的组合指标。GPT-5.6 Sol10.003/3
      查看各次运行
      运行 1 · 10.00

      自然得分: 31.90
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      运行 2 · 10.00

      自然得分: 34.43
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      运行 3 · 10.00

      自然得分: 34.43
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      根据逐笔贷款资格及融资约束计算借款基数。GPT-5.6 Sol10.003/3
      查看各次运行
      运行 1 · 10.00

      自然得分: 17.14
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      运行 2 · 10.00

      自然得分: 25.00
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      运行 3 · 10.00

      自然得分: 24.29
      最终得分: 10.00
      得分上限: 10.00

      有效保留提交

      应用贷款资格规则并核对形成的组合指标。GPT-6 Astra100.000/3
      查看各次运行
      运行 1 · 100.00

      自然得分: 100.00
      最终得分: 100.00
      得分上限: 未触发

      有效保留提交

      运行 2 · 100.00

      自然得分: 100.00
      最终得分: 100.00
      得分上限: 未触发

      有效保留提交

      运行 3 · 100.00

      自然得分: 100.00
      最终得分: 100.00
      得分上限: 未触发

      有效保留提交

      根据逐笔贷款资格及融资约束计算借款基数。GPT-6 Astra25.003/3
      查看各次运行
      运行 1 · 25.00

      自然得分: 25.00
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 2 · 25.00

      自然得分: 25.00
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 3 · 25.00

      自然得分: 25.00
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      05并购与融资查看任务GPT-5.6 Sol9.342/2 任务 · 1/6 次触发上限GPT-6 Astra41.002/2 任务 · 6/6 次触发上限
      任务模型平均得分触发上限运行证据
      通过联动的汇率、税务与现金流情景比较融资结构。GPT-5.6 Sol12.441/3
      查看各次运行
      运行 1 · 5.42

      自然得分: 5.42
      最终得分: 5.42
      得分上限: 未触发

      有效保留提交

      运行 2 · 6.91

      自然得分: 6.91
      最终得分: 6.91
      得分上限: 未触发

      有效保留提交

      运行 3 · 25.00

      自然得分: 33.12
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      对不同融资路径及其汇率与税务影响进行建模。GPT-5.6 Sol6.230/3
      查看各次运行
      运行 1 · 6.47

      自然得分: 6.47
      最终得分: 6.47
      得分上限: 未触发

      有效保留提交

      运行 2 · 7.95

      自然得分: 7.95
      最终得分: 7.95
      得分上限: 未触发

      有效保留提交

      运行 3 · 4.28

      自然得分: 4.28
      最终得分: 4.28
      得分上限: 未触发

      有效保留提交

      通过联动的汇率、税务与现金流情景比较融资结构。GPT-6 Astra38.253/3
      查看各次运行
      运行 1 · 34.49

      自然得分: 34.49
      最终得分: 34.49
      得分上限: 49.00

      有效保留提交

      运行 2 · 38.64

      自然得分: 38.64
      最终得分: 38.64
      得分上限: 49.00

      有效保留提交

      运行 3 · 41.63

      自然得分: 41.63
      最终得分: 41.63
      得分上限: 49.00

      有效保留提交

      对不同融资路径及其汇率与税务影响进行建模。GPT-6 Astra43.743/3
      查看各次运行
      运行 1 · 42.25

      自然得分: 42.25
      最终得分: 42.25
      得分上限: 49.00

      有效保留提交

      运行 2 · 44.49

      自然得分: 44.49
      最终得分: 44.49
      得分上限: 49.00

      有效保留提交

      运行 3 · 44.49

      自然得分: 44.49
      最终得分: 44.49
      得分上限: 49.00

      有效保留提交

      06IRR 与可比分析查看任务GPT-5.6 Sol19.682/2 任务 · 6/6 次触发上限GPT-6 Astra38.852/2 任务 · 3/6 次触发上限
      任务模型平均得分触发上限运行证据
      在融资与流动性约束下比较项目现金流和回报。GPT-5.6 Sol21.313/3
      查看各次运行
      运行 1 · 24.32

      自然得分: 24.32
      最终得分: 24.32
      得分上限: 25.00

      有效保留提交

      运行 2 · 14.59

      自然得分: 14.59
      最终得分: 14.59
      得分上限: 25.00

      有效保留提交

      运行 3 · 25.00

      自然得分: 25.54
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      根据所给输入及输出要求建立可审计的资本预算模型。GPT-5.6 Sol18.063/3
      查看各次运行
      运行 1 · 20.68

      自然得分: 20.68
      最终得分: 20.68
      得分上限: 25.00

      有效保留提交

      运行 2 · 25.00

      自然得分: 31.62
      最终得分: 25.00
      得分上限: 25.00

      有效保留提交

      运行 3 · 8.51

      自然得分: 8.51
      最终得分: 8.51
      得分上限: 25.00

      有效保留提交

      在融资与流动性约束下比较项目现金流和回报。GPT-6 Astra65.140/3
      查看各次运行
      运行 1 · 64.73

      自然得分: 64.73
      最终得分: 64.73
      得分上限: 未触发

      有效保留提交

      运行 2 · 64.73

      自然得分: 64.73
      最终得分: 64.73
      得分上限: 未触发

      有效保留提交

      运行 3 · 65.95

      自然得分: 65.95
      最终得分: 65.95
      得分上限: 未触发

      有效保留提交

      根据所给输入及输出要求建立可审计的资本预算模型。GPT-6 Astra12.573/3
      查看各次运行
      运行 1 · 10.95

      自然得分: 10.95
      最终得分: 10.95
      得分上限: 25.00

      有效保留提交

      运行 2 · 14.59

      自然得分: 14.59
      最终得分: 14.59
      得分上限: 25.00

      有效保留提交

      运行 3 · 12.16

      自然得分: 12.16
      最终得分: 12.16
      得分上限: 25.00

      有效保留提交 · 获准替换

      搜索只定位任务,不重新计算类别均值。排序描述选定样本,不代表公平的能力排名。

      06 / 得分与约束

      评分上限生效前后。

      查看全部类别数值
      工作流模型自然得分最终得分
      DCF 与经营模型GPT-5.6 Sol31.9620.00
      DCF 与经营模型GPT-6 Astra51.7646.59
      杠杆收购GPT-5.6 Sol20.4813.50
      杠杆收购GPT-6 Astra28.7524.21
      现金流GPT-5.6 Sol34.8628.50
      现金流GPT-6 Astra35.9127.22
      贷款资产池GPT-5.6 Sol27.8610.00
      贷款资产池GPT-6 Astra62.5062.50
      并购与融资GPT-5.6 Sol10.699.34
      并购与融资GPT-6 Astra41.0041.00
      IRR 与可比分析GPT-5.6 Sol20.8819.68
      IRR 与可比分析GPT-6 Astra38.8538.85

      自然得分是账本记录的封顶前得分,并非准确率,也可能已受其他评分规则影响。硬性上限只限制最终得分,不增加分数。 悬停或点击条形,查看任务与各次运行得分。

      07 / 方法论

      以证据为基础,让评分可验证。

      金融任务、可执行工作流与可衡量的奖励,共同构成开箱即用的 RL 环境。自然得分反映完成质量;未满足关键要求时,硬性上限约束最终得分。执行记录与封存提交让结果可追溯、可复核。

      先验证证据,再授予分数

      Toneme · 评测方法论
      1. 01任务与素材
      2. 02记录执行
      3. 03冻结提交
      4. 04评测
        自然得分获得的质量分数
        硬性评分上限约束得分
        最终得分
        这是上限,而不是奖励。
      5. 05可审计结果
      执行轨迹步骤、工具、记录时间
      受控回放Docker 配置 · 隔离运行
      证据绑定提交校验值 · 评分回执

      检查因题型而异;基础设施失败不计分。

      评测设计概览。具体检查与回放机制因题型而异。

      完整 RL 环境,开箱即用。

      我们配套交付任务环境、源文件、Docker 配置、执行约定与奖励评估组件。安装所需运行时及镜像后,研究人员可通过随附工作流运行 Agent、收集轨迹并评分。评估包提供环境与评分组件,本网站展示公开证据。

      奖励质量,约束捷径。

      自然得分记录任务获得的分数;关键要求未满足时,硬性上限限制得分。适用检查考察公式、重算及输入响应,减少仅凭看似合理的静态答案获得分数的空间。这些机制针对具体失败模式,不构成完全抵御奖励破解的证明。

      控制运行条件,保留原始提交。

      Docker 配置与记录的运行参数支持检查和回放。Type06 回放使用新容器、只读任务输入及独立输出目录,并核对执行前后的提交校验值。该题型的重算与公式缓存检查有助于识别工作簿中的过期数值。这些控制降低残留状态风险;回放仍依赖所需镜像和计算环境。

      将证据与结果关联。

      选定的 Astra 运行包含步骤与时间戳。提交校验值、评分回执与验收账本将保留结果与证据关联。在所记录的恢复配置下,基础设施失败不计分,不被转换成模型失败,也不用于重跑有效低分提交。

      全页使用同一计算口径。

      分数统一采用 0–100 刻度。先计算每道任务各次保留运行的均分,再对已覆盖任务等权平均;类别内沿用相同规则,并明确展示覆盖范围。比较模型前,应考虑任务数量与选择协议的差异。

      通过限定范围的试点评估训练效果。

      本样例展示不构成对训练增益或模型排名的统计结论。训练效果应针对目标模型与目标,通过限定范围的试点进行评估。

      继续技术交流

      讨论私有评估包。

      对私有评估包或更广泛的任务集感兴趣?请通过邮件讨论你的模型、工作流与评估目标。

      索取私有评估包

      jaredleung@toneme.ai