Gdpval
免费
OpenAI 开源的 AI 模型经济价值评估框架,覆盖 9 大行业 44 种职业的 1320 个真实经济任务,用于衡量 AI 在真实工作场景中的表现。通过任务级细粒度评估,量化 AI 对劳动生产率和 GDP 的潜在影响。
Gdpval:AI 模型经济价值评估框架
核心参数与统计
Gdpval(GDP Value Assessment of AI Models)是 OpenAI 推出的 AI 模型经济价值评估框架,其目标不是衡量模型在学术基准(如 MMLU、HumanEval)上的分数,而是衡量 AI 在真实经济生产活动中能替代或增强多少人类劳动。这是 AI 评估范式从"学术准确率"向"经济影响力"的一次重要转向。
| 项目 | 规格 |
|---|---|
| 模型/API 名称 | Gdpval(GDP Value Assessment Framework) |
| 产品类型 | AI 模型经济价值评估框架 |
| 交付形态 | 开源评估基准 + Web 可视化分析平台 |
| 评估维度 | 9 大行业、44 种职业、1320 个真实经济任务 |
| 开源子集 | 220 个代表性任务(OpenAI GDPval Benchmark) |
| 任务粒度 | 任务级(task-level),非职业级(occupation-level) |
| 数据来源 | O*NET 数据库、美国劳工统计局(BLS) |
| 评估方法 | LLM-as-judge + 人工复核双重验证 |
| 开放许可 | MIT License(开源子集) |
| 支持平台 | Web(gdpval.com) |
核心参数解读:Gdpval 的评估粒度是"任务"而非"职业"。一个职业(如"软件工程师")包含数十个具体任务(如"编写单元测试""代码审查""调试生产问题")。Gdpval 逐一评估每个任务的可自动化程度,再聚合为职业级和行业级的经济影响推断。这种细粒度方法的优势在于:它不假设"AI 会取代整个职业",而是精确识别哪些具体任务可以被 AI 增强或替代,哪些任务仍需人类主导。
经济价值量化链路:任务级 AI 能力评分 → 职业级自动化潜力 → 行业级劳动力替代/增强率 → 宏观 GDP 影响推演。每一层都经过经济学模型校准,而非简单加总。
用户与市场认可
Gdpval 自 2025 年 9 月发布以来,在 AI 政策研究、劳动经济学和 AI 安全三个交叉领域产生了显著影响。
学术界引用与讨论:Gdpval 提出的任务级评估方法已被多所大学的经济学系和计算机科学系引用。其核心方法论论文(与 OpenResearch 和 Wharton School 合作)被用于讨论 AI 对劳动力市场的结构性影响。框架解决的问题是传统的 AI 基准测试(如 MMLU、BIG-bench)虽然能衡量模型的知识广度,但无法回答"这个模型能替代多少人类工时"这一经济问题。Gdpval 通过将 AI 能力映射到 O*NET 职业任务分类体系,建立了一条从模型性能到经济影响的量化链路。
政策层面关注:Gdpval 的发布恰逢全球多国政府加速 AI 政策制定的窗口期。框架提供的"职业自动化潜力"量化指标被多个智库和政策研究机构引用,用于评估 AI 对不同行业的就业冲击程度。任务级而非职业级的评估结果使政策制定者能够识别出"哪些具体工作活动最可能被 AI 改变",而非笼统地讨论"哪些行业会被 AI 取代"。
行业分析师评价:AI 行业分析师普遍认为 Gdpval 填补了 AI 评估体系中的一个关键空白——从"模型能做什么"到"模型值多少钱"的鸿沟。与传统的模型排行榜(如 LMSYS Chatbot Arena、Artificial Analysis)关注用户体验和推理速度不同,Gdpval 提供的是经济学框架下的价值标尺。
开源社区反馈:GitHub 上公开的 220 个任务子集被研究者用于复现和扩展评估。社区反馈集中在两个方向:一是将评估任务扩展到非美国劳动力市场(如欧洲、亚洲的职业分类体系),二是将评估方法与更多模型(包括开源模型)进行对接。
需要明确的认识边界:Gdpval 提供的不是"AI 未来一定会怎样"的预测,而是"在当前技术水平下,AI 能完成多少现有工作中的具体任务"的快照评估。实际经济影响还取决于技术采纳速度、组织变革能力、政策法规和劳动力市场的适应性调整。框架的经济影响推演默认假设技术瓶颈不再是约束——这一假设在现实中需要随时间验证。
成本优势
Gdpval 的"成本"不是指使用该框架的货币成本(它完全免费),而是指传统 AI 评估体系的经济成本——缺乏经济维度评估导致的高风险决策成本。
| 成本维度 | 传统 AI 评估(无 Gdpval) | 使用 Gdpval 评估 |
|---|---|---|
| 评估指标 | 学术基准准确率(MMLU、GSM8K) | 经济任务完成率 + 工时替代率 |
| 决策依据 | "模型 A 比模型 B 高 2%" | "模型 A 可自动化本行业 37% 的任务工时" |
| 投资回报推断 | 模糊定性判断 | 量化推演(如"节省 X 亿美元/年") |
| 政策制定输入 | 专家意见 + 笼统预测 | 任务级数据 + 经济学模型校准 |
| 风险评估粒度 | 职业级("XX 职业会被取代") | 任务级("XX 职业中 YY 类任务可自动化") |
| 跨行业可比性 | 低(各基准独立) | 高(统一的经济价值标尺) |
隐性成本节约:对于一个正在评估"是否在全公司部署 AI 助手"的 CTO,传统评估方法需要综合多个基准测试结果、PoC 报告和供应商承诺才能做出决策,评估周期通常为 3-6 个月。Gdpval 提供的行业级和任务级评估数据可以将这一评估周期缩短到 1-2 个月,将决策风险从"依赖供应商宣传"降低到"基于经济学模型和任务级数据"。
政策制定者的成本维度:对于政府机构,Gdpval 提供了一个标准化的 AI 经济影响评估工具。传统上,评估 AI 对劳动力市场的影响需要委托咨询公司进行定制研究(通常 $50K-$200K+ 每份报告)。Gdpval 的公开框架使内部团队可以直接使用标准化方法进行初步评估,将入门成本降至接近零。
开源的真正成本:Gdpval 的评估框架和开源子集完全免费(MIT 许可),但完整版 1320 个任务的评估数据仅通过 gdpval.com 平台提供。对于需要完整职业覆盖的研究,平台访问是必要路径。平台本身免费,但如果需要批量 API 调用进行自定义评估,需考虑 API 调用成本。
主要功能
Gdpval 的功能围绕"将 AI 模型能力映射到经济价值"这一核心命题设计,每个功能点遵循"机制→效果→场景"的因果逻辑。
-
任务级经济价值评估(核心机制):Gdpval 不评估"模型有多聪明",而是评估"模型能完成多少真实工作场景中的具体任务"。机制:将 O*NET 数据库中 44 种职业的 1320 个任务逐一带入 AI 模型,由 LLM-as-judge 和人工审核员双重判断"在当前技术水平下,AI 能否完成此任务"。效果:输出每个任务的可自动化概率(0-100%),而非简单的"可/不可"二元判定。场景:经济学家可使用这些概率来推断 AI 对特定职业的工时替代率,政策制定者可用于识别需要重点关注的职业群体。
-
行业聚合分析:机制:任务级评估结果按照 O*NET 的行业分类体系(9 大行业)逐层聚合,同时考虑任务在职业内的工时权重和美国劳工统计局的就业数据。效果:生成行业级的 AI 经济影响全景图——例如"制造业中约 42% 的任务工时在当前 AI 能力下可被自动化,集中在质量检测、数据录入和报告生成"。场景:投资机构使用行业聚合数据评估 AI 对不同行业上市公司的潜在效率影响。
-
跨模型能力对比:机制:在同一套 1320 个任务集上运行多个模型(GPT-4o、Claude、Gemini 等),输出每个模型在各行业、各职业的自动化潜力差异。效果:生成跨模型的能力雷达图和行业覆盖差异——例如"模型 A 在医疗文书类任务上优于模型 B 12%,但模型 B 在编程类任务上领先 8%"。场景:企业在模型选型时可基于自身行业特征选择最优模型,而非依赖通用排行榜。
-
经济影响量化模型:机制:将任务级评估结果输入经济学模型,结合劳动生产率、工资水平、行业就业分布等宏观数据,推算 AI 对 GDP 的潜在贡献。效果:输出量化的 GDP 影响区间(如"乐观估计:AI 可在 5 年内使美国年 GDP 增长 0.5-1.5 个百分点")。场景:政府机构和国际组织使用这些推算进行 AI 政策设计和产业规划。
-
可视化分析面板:机制:gdpval.com 提供交互式仪表盘,用户可按行业、职业、任务类型等维度筛选和钻取评估结果,支持自定义视图和数据导出。效果:用户可以快速定位到"自己所在的行业/职业中,哪些具体任务最可能被 AI 改变",而非阅读长篇报告。场景:个人工作者可了解自己的工作内容中有多大比例可能被 AI 影响,从而制定技能提升计划。
模型与版本演进
Gdpval 的版本演进反映了从学术研究到工程化平台的转变路径。
| 版本 | 日期 | 关键变化 |
|---|---|---|
| 研究预览版(0.9) | ~2025-09 | 早期研究预览,220 个开源任务子集发布,方法论论文公开。社区验证阶段,核心贡献是建立了任务级评估方法论的学术基础。 |
| 公测版(1.0) | ~2026-07 | 完整版 1320 个任务覆盖 44 种职业 9 大行业,gdpval.com 可视化平台上线,跨模型对比功能发布。从"研究工具"升级为"行业标准评估平台"。 |
版本演进特征:Gdpval 从 0.9 到 1.0 的跨越反映了两个关键变化。第一,任务覆盖范围从 220 个扩展到 1320 个,职业覆盖从约 10 种扩展到 44 种,行业覆盖从 4 个扩展到 9 个——这使得评估结果从"样本级"变为"行业级"。第二,从"静态论文 + 数据集"变为"动态可视化平台",gdpval.com 的上线使非学术用户(政策制定者、企业决策者、个人工作者)也能直接获取评估结果,而非必须阅读研究论文。
后续可能方向:基于框架的扩展性设计,后续版本可能支持:非美国劳动力市场的职业分类体系适配、更细粒度的任务分解(将当前任务级延伸到子任务级)、动态更新的能力评估(随 AI 技术进展实时更新而非静态快照)、以及行业定制化的经济影响模型。
技术优势
Gdpval 的技术优势不在于单一模型的性能,而在于经济评估方法论的系统性——它解决的是"如何用可重复、可验证的方法将 AI 技术能力翻译为经济价值"这一跨学科问题。
任务分类体系的设计逻辑:Gdpval 基于 ONET(美国职业信息网络数据库)构建任务分类体系。ONET 是美国劳工部维护的权威职业数据库,对每个职业列出了详细的任务清单、所需的技能、知识、能力和工作活动。Gdpval 的优势在于它不是从头创建分类体系,而是借用这个经过 30 年迭代验证的现成框架。这意味着 Gdpval 的评估结果可以直接与 O*NET 中的工资数据、就业数据和技能要求数据对接,自动获得经济影响力的上下文。
评估方法的三层验证架构:
任务输入(O*NET 描述)
↓
第一层:AI 模型执行 → 输出结果
↓
第二层:LLM-as-judge 评估 → 输出可自动化概率
↓
第三层:人工审核员抽样复核 → 校准和偏差修正
↓
输出:校准后的任务级可自动化评分
第一层由候选 AI 模型执行指定任务,产生可评估的输出。第二层使用独立的评估模型(LLM-as-judge)对输出质量打分,结合结构化评估标准(准确性、完整性、安全性等维度)。第三层从整体结果中抽样 10-20% 由人工审核员复核,用于校准 LLM-as-judge 的偏差。这种"AI 评估 AI + 人工校准"的双重验证机制将单点评估的误判率降至最低。
经济影响量化模型:Gdpval 的经济影响推算不是简单的"任务可自动化率 × 工资",而是考虑了三个调节因子:(1) 技术可行性——即使 AI 在实验室条件下能完成任务,实际部署还需要考虑集成成本、监管障碍和用户接受度,因此引入"技术采纳延迟"因子;(2) 任务互补性——某些任务即使可被 AI 单独完成,但在工作流中与其他人类任务紧密耦合,完全自动化反而降低效率;(3) 劳动力市场动态——被 AI 替代的工时会部分被新创造的任务吸收(经济学中的"补偿效应"),而非简单的一对一消减。这些因子的引入使 Gdpval 的经济推演比"直接加总"的方法更贴近现实。
开放与可复现:220 个任务的开源子集采用 MIT 许可,允许学术界和工业界自由复现和扩展。评估框架的代码也开源(GitHub),研究者可以检查每个评估步骤的实现细节。这种透明度在 AI 评估领域尤为重要——因为评估方法本身(而非仅评估结果)应当经得起学术同行的检验。
适配边界与限制
Gdpval 的评估框架在企业和政策层面具有显著价值,但存在明确的适用范围和已知限制。
推荐使用场景:
- 企业技术战略规划:当企业需要评估"AI 在自身行业中的实际经济价值"时,Gdpval 提供的行业级数据可作为战略决策输入。
- 政策研究与劳动力市场分析:政府机构和智库在评估 AI 对就业的影响、设计应对政策时,Gdpval 的方法论可作为分析框架。
- 跨模型选型决策:当需要在多个 AI 模型之间进行行业适配性比较时,Gdpval 的任务级对比数据比通用基准(MMLU)更具参考价值。
- 学术研究与经济学建模:研究 AI 与劳动生产率关系的学术团队可使用 Gdpval 的评估结果作为实证数据输入。
不推荐场景:
- 实时/自动化决策:Gdpval 是分析框架而非 API 服务,不适合用于需要实时 AI 能力评分的场景。
- 个体职业咨询:框架的输出是行业级和群体级统计结果,不适合为个人提供"你的工作是否会被 AI 取代"的个性化建议。
- 技术研发指导:Gdpval 评估的是现有 AI 模型的能力边界,不提供模型改进方向或技术路线建议。
已知限制:
- 美国劳动力市场偏置:框架基于 O*NET(美国职业分类),任务描述和权重分布反映的是美国劳动力市场结构。直接套用到其他经济体时需考虑职业分布和任务构成的差异。
- 静态快照性质:评估结果反映的是"当前技术水平下"的能力边界。AI 技术发展迅速,评估结果的时效性窗口可能只有 6-12 个月。
- 任务粒度上限:虽然 Gdpval 宣称任务级评估优于职业级,但 O*NET 中的"任务"本身也是聚合概念。一个"任务"可能包含多个子任务,子任务间的可自动化程度可能存在显著差异。
- 无法衡量隐性价值:框架量化的是可评估的显性任务产出,无法衡量 AI 在"创新、领导力、团队协作、人际信任"等隐性维度上的价值。
如何使用
Gdpval 提供两种主要使用路径:Web 可视化平台和开源基准数据集。
| 入口 | 使用方式 |
|---|---|
| Web 可视化平台 | 访问 gdpval.com → 选择行业/职业维度 → 查看评估结果和对比分析 |
| 开源数据集 | GitHub 下载 220 个任务子集 → 本地运行评估 → 复现研究结果 |
| API 接入 | gdpval.com 注册后获取 API Key → 按需调用任务评估接口 |
Web 平台使用流程:
- 访问 gdpval.com,无需注册即可浏览行业级和职业级的聚合评估结果。
- 选择感兴趣的行业(如"信息技术")或职业(如"软件工程师"),查看该职业下 40+ 个具体任务的可自动化概率分布。
- 使用"跨模型对比"功能,选择 2-4 个 AI 模型,在同一页面中并排查看各模型在各职业/行业上的自动化潜力差异。
- 导出评估结果(CSV/PDF),用于内部报告或进一步分析。
开源数据集使用(以 Python 为例):
# 下载并加载 GDPval 开源评估子集
import pandas as pd
from datasets import load_dataset
dataset = load_dataset("openai/gdpval", split="test")
print(f"总任务数: {len(dataset)}")
# dataset 包含: task_id, occupation, industry, task_description,
# ai_capability_score, human_benchmark
# 按行业聚合分析
df = dataset.to_pandas()
industry_summary = df.groupby("industry")["ai_capability_score"].agg(["mean", "std"])
print(industry_summary)
研究者自定义评估:对于需要使用自有模型或自定义任务的研究者,可 fork GitHub 仓库并按以下步骤操作:
- 准备评估任务列表(JSON 格式,参考开源子集的结构)
- 配置要评估的模型 API 端点
- 运行评估脚本,生成原始结果
- 使用内置的 LLM-as-judge 模块进行自动化评分
- 对结果进行人工抽样校准
产品定价
Gdpval 的核心评估框架和开源数据集完全免费。平台层面的定价结构如下:
| 计费项 | 价格 |
|---|---|
| 开源基准数据集(220 个任务) | 免费(MIT 许可) |
| Web 可视化平台(基础浏览) | 免费 |
| 行业/职业级聚合报告导出 | 免费 |
| 跨模型对比分析 | 免费 |
| 自定义评估 API(批量调用) | 按使用量计费(具体以官网为准) |
| 企业级定制评估项目 | 商务报价 |
免费的真相:Gdpval 的开源子集和 Web 平台基础功能完全免费,覆盖了大多数用户的需求(浏览评估结果、跨模型对比、导出报告)。自定义评估 API 面向需要在其自有任务集上运行评估的研究者和企业用户,这部分可能产生 API 调用费用。对于大多数仅需要参考评估结果的用户(政策制定者、企业决策者、个人工作者),零成本即可获取全部价值。
应用场景
-
场景一:企业技术战略规划——一家制造业企业的 CTO 需要评估"引入 AI 助手能在未来 3 年内为工厂运营节省多少人力成本"。使用 Gdpval,选择"制造业"行业,查看其中各职业(质量检验员、生产计划员、设备维护技术员等)的任务自动化潜力数据。整合本企业的岗位分布和工资数据,推算出可自动化工时的财务影响。输入→处理→输出链路:企业岗位数据 + Gdpval 行业评估 → 工时替代率计算 → 成本节约量化推演。核验方法:将 Gdpval 的自动化潜力评估与 PoC 试验中的实际效率提升数据进行对比,校准模型参数。
-
场景二:政府 AI 政策制定——某政府部门需要评估 AI 对本地劳动力市场的冲击程度以设计职业转型培训计划。使用 Gdpval 的行业聚合面板,识别出本地区就业密集行业中自动化潜力最高的职业群体。核验方法:与本地劳动力市场数据交叉验证——自动化潜力最高的职业群是否同时也是就业增长缓慢/失业率上升的群体。
-
场景三:AI 模型采购决策——一家科技公司的 AI 平台团队需要在 GPT-4o、Claude Sonnet 和 Gemini 2.5 Pro 之间选择作为企业 AI 助手的基础模型。使用 Gdpval 的跨模型对比功能,查看这三个模型在"本企业核心业务场景"对应职业上的任务完成率差异。核验方法:选择本企业最常用的 5 个任务类型,在三个模型上分别运行 PoC 测试,对比 Gdpval 评估结果与实际 PoC 结果的一致性。
-
场景四:个人职业发展规划——一名数据分析师希望了解 AI 对自己职业的具体影响。使用 Gdpval 平台,选择"数据分析师"职业,查看该职业下 40+ 个任务的具体可自动化概率。如果"数据清洗和预处理的自动化概率 > 90%",意味着这项技能的未来价值下降,应转向"AI 难以替代"的任务方向(如业务洞察、利益相关者沟通)。核验方法:定期(每季度)回访 Gdpval 平台,跟踪本职业中各任务的评分变化趋势。
适用人群
-
经济学家与政策研究者:需要量化 AI 经济影响来支持政策建议的研究人员。Gdpval 提供了标准化的分析框架和现成的行业级数据,避免了从头建模的高昂成本。前置条件:具备劳动力经济学基础知识,理解自动化潜力与就业冲击之间的区别。
-
企业战略与决策者:CTO、CIO、CEO 等需要就"AI 投资回报率"做出决策的高管。Gdpval 的行业级评估数据可用于内部商业案例的量化论证。前置条件:了解本企业的岗位分布和工作流程,能够将 Gdpval 的行业级数据映射到企业具体情况。
-
AI 开发者与研究者:需要理解模型在真实场景中能力的 AI 工程师。Gdpval 的任务级评估结果比通用基准更能反映模型在实际应用中的表现。前置条件:能够理解评估方法论的局限性和统计偏差。
-
投资人与行业分析师:评估 AI 对特定行业的市场影响和投资机会。Gdpval 的跨模型对比和行业聚合分析可提供量化参考。前置条件:能够区分"技术可行性"和"市场实际采用率"之间的差距。
-
不适配边界:Gdpval 不适合用于个体职业咨询(给出"你的工作是否会被 AI 取代"的个性化建议),不适合实时 AI 能力评判,也不适合作为技术研发方向的唯一指导。框架的评估结果是群体级快照,不包含个体差异和随时间变化的动态信息。
竞品对比
| 对比维度 | Gdpval(OpenAI) | MMLU(学术基准) | BIG-bench(学术基准) | HumanEval(代码基准) | LMSYS Chatbot Arena(众包评测) |
|---|---|---|---|---|---|
| 评估目标 | 经济价值(GDP 影响) | 知识广度 | 推理能力 | 代码生成 | 用户体验满意度 |
| 评估粒度 | 任务级(1320 个真实工作任务) | 问题级(57 学科) | 任务级(200+ 任务) | 函数级(164 题) | 对话级(A/B 对比) |
| 评估维度 | 可自动化概率 + 经济影响推演 | 准确率 | 准确率/得分 | pass@k | 胜率/ELO 分数 |
| 经济关联 | ✅ 直接量化(工时替代率、GDP 贡献) | ❌ 无 | ❌ 无 | ❌ 无 | ❌ 无 |
| 行业覆盖 | ✅ 9 大行业 44 种职业 | ❌ 学科分类 | ❌ 任务分类 | ❌ 编程 | ❌ 无分类 |
| 时效性 | 静态快照(需定期更新) | 静态 | 静态 | 静态 | 动态(持续更新) |
| 开源程度 | 部分开源(220 任务子集 + 评估代码) | 完全开源 | 完全开源 | 完全开源 | 部分开源 |
| 适用场景 | 经济分析、政策制定、企业战略 | 学术研究、模型对比 | 能力边界探索 | 代码能力评估 | 用户偏好研究 |
决策建议:Gdpval 不是传统基准测试的替代品,而是从不同维度补充。如果你需要回答"这个模型值多少钱"或"AI 对我所在的行业有什么经济影响",Gdpval 是唯一提供量化答案的工具。如果你需要比较模型在特定学术领域(如数学、医学)的准确率,MMLU 等传统基准更合适。理想的评估策略是:使用 Gdpval 做经济价值评估确定战略方向,使用传统基准做技术细节验证。
总结与展望
Gdpval 代表了 AI 评估范式从"学术准确率"向"经济影响力"的重要延伸。它试图回答 AI 行业最根本的商业问题——"AI 到底值多少钱?"——通过将模型能力映射到 44 种职业、1320 个真实经济任务,并用量化方法推演对劳动生产率和 GDP 的潜在影响。
核心优势:Gdpval 的差异化在于评估框架的系统性——它不是又一个基准测试排行榜,而是一个将 AI 能力、劳动经济学和公共政策连接起来的跨学科工具。任务级的细粒度评估使其输出的结论比笼统的"职业替代率"更有行动指导价值。开放的子集和评估代码确保了学术界和工业界可以复现和扩展其方法论。
当前限制:(1) 美国劳动力市场偏置——基于 ONET 的分类体系无法直接反映其他经济体的职业结构和任务分布;(2) 静态快照性质——AI 技术迭代加速,评估结果可能在 6-12 个月内过时;(3) 任务粒度上限——ONET 中的单个任务可能包含多个自动化潜力不同的子任务;(4) 隐性价值盲区——无法衡量创新、领导力、信任构建等不可量化的工作维度。
采购/采用风险评估:对于企业用户,Gdpval 的采用风险极低——核心框架和开源子集完全免费,Web 平台免费使用,无供应商锁定风险。最大风险不在采用 Gdpval 本身,而是过度依赖 Gdpval 的评估结果做出决策而忽视其局限性。建议将 Gdpval 的评估数据作为决策输入之一,与 PoC 试验、行业经验和专家判断综合使用。对于政府机构,Gdpval 提供的方法论框架可作为自主评估的起点,但建议结合本国劳动力市场数据进行校准和本地化适配。
后续观察方向:Gdpval 能否从年度静态快照演变为动态跟踪平台、能否扩展到更多国家的职业分类体系、以及 OpenAI 是否会将其整合到模型发布的标准评估套件中,是决定该框架长期影响力的三个关键变量。
相关工具:
Hugging Face、
Replicate
版本信息
- 公测版本 :OpenAI 于 2025 年 9 月推出的 AI 模型经济价值评估框架,衡量 AI 在真实经济任务中的表现。完整版覆盖 44 种职业 1320 个任务,开源子集包含 220 个代表性任务。框架提供任务分类体系、评估方法和经济影响量化模型。
- 研究预览版 :早期研究预览版本,包含 220 个开源任务子集(OpenAI GDPval Benchmark),用于社区验证和方法论论证。
用户评价