
人工智能大模型预训练深度学习NLP计算机视觉多模态语音【免费下载链接】unilmLarge-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities项目地址https://gitcode.com/GitHub_Trending/un/unilm点击查看免费下载导读本文聚焦 ReSARectified Sparse Attention 项目中minerva_math评测数据集的来源、数据结构与消费方式。该数据集位于 ReSA/math_data/minerva_math/其 README 明确指出数据源自 MIT OpenCourseWare并引用了 Minerva 论文《Solving Quantitative Reasoning Problems with Language Models》。阅读本文后你将掌握该数据集的字段格式、课程构成、在 ReSA 数学评测体系中的定位以及从数据加载、Prompt 构造到答案抽取与准确率统计的完整调用链。Minerva 数据集的来源MIT OpenCourseWare 与定量推理评测ReSA/math_data/minerva_math/README.md 的全文只有两行但信息量并不小MIT OpenCourseWare: - Solving Quantitative Reasoning Problems with Language Models. https://openreview.net/forum?idIFXTZERXdM7它点明了两件事数据出处minerva_math的题目来自 MIT OpenCourseWareMIT OCW即麻省理工学院公开课程中真实布置的作业题与考题评测范式出处评测方式沿用《Solving Quantitative Reasoning Problems with Language Models》即 Google 的 Minerva 论文发布于 OpenReview中提出的定量推理评测设定——要求模型面对大学水平的数学、物理、化学、经济等学科题目输出带有\boxed{}标记的最终答案。因此minerva_math在本仓库中是一份大学级跨学科定量推理quantitative reasoning基准与 Gaokao2023En、OlympiadBench、AIME24、AMC23 等一起构成 ReSA 的长上下文数学推理评测矩阵。这一点可以从 ReSA/llm/eval_math.py 的默认评测列表得到印证data_names minerva_math,gaokao2023en,olympiadbench,aime24,amc23 # data_names gsm8k,math,svamp,asdiv,mawps,carp_en,tabmwp,minerva_math,gaokao2023en,olympiadbench,college_math,aime24,amc23在 ReSA/README.md 的数学推理任务性能对比表中Minerva 列与 Gaokao2023En、OlympiadBench、AIME24、AMC23 并列且在 R1-Qwen-Distill 1.5B / 7B 两个规模下均统计了 Dense、Sparse、ReSA 三种解码方式下的准确率与平均生成长度1.5B 下 Avg Length 6390.87B 下 4018.7是检验 ReSA 在超长推理链场景下保持近无损质量的关键数据集之一。数据文件与字段结构test.jsonl 逐行剖析minerva_math目录下除 README 外只有一个数据文件ReSA/math_data/minerva_math/test.jsonl共 272 行每条 JSON 一行。每一行包含 4 个字段字段类型说明problemstr题目文本通常内嵌 LaTeX 公式如$6.5 \mathrm{~m}$solutionstr官方参考答案以 LaTeX 撰写最终答案用\boxed{...}包裹typestr题目来源课程如Introduction to Astronomy (8.282J Spring 2006)idxint样例编号从 0 开始且与行序一致已排序以下面这条真实样例idx0为例{problem: Each of the two Magellan telescopes has a diameter of $6.5 \\mathrm{~m}$. In one configuration the effective focal length is $72 \\mathrm{~m}$. Find the diameter of the image of a planet (in $\\mathrm{cm}$ ) at this focus if the angular diameter of the planet at the time of the observation is $45^{\\prime \\prime}$., solution: Start with:\n\\[\ns\\alpha f \\text {, }\n\\]\nwhere $s$ is the diameter of the image, $f$ the focal length, and $\\alpha$ the angular diameter of the planet. For the values given in the problem:\n\\[\ns\\frac{45}{3600} \\frac{\\pi}{180} 7200\\boxed{1.6} \\mathrm{~cm}\n\\], type: Introduction to Astronomy (8.282J Spring 2006), idx: 0}课程分布统计整个文件可得 272 条数据覆盖 9 门 MIT 课程数字为条数Introduction to Solid State Chemistry (3.091 Fall 2010)97Introduction to Astronomy (8.282J Spring 2006)53Differential Equations (18.03 Spring 2010)48Dynamics and Control (2.003 Spring 2005)26Principles of Microeconomics (14.01 Fall 2011)18Relativity (8.033 Fall 2006)11Physical Chemistry (5.61 Fall 2017)11Ecology I (1.018J Fall 2009)5Information and Entropy (6.050J Spring 2008)3从样本内容看这些题目涵盖天文望远镜分辨率、视差、星等、多普勒红移、物理玻尔模型、斯涅尔定律、流体静力学平衡、微分方程、微观经济学、信息熵等学科数学符号密度高、推导链条长且不少题目包含 Preamble/Subproblem 多步结构天然适合检验模型在长序列生成 数学推导条件下的推理质量。答案格式特点272 条solution全部包含\boxed{...}包裹的最终答案个别条目还带The final answer is ... I hope it is correct.的表述如 idx5 中的\boxed{np.arcsin(10/13)}。这一格式约定直接影响评测代码的答案抽取逻辑见下文也是 Minerva 论文所定义的答案必须放入 boxed范式的直接体现。评测管线minerva_math 如何被 ReSA 消费1. 数据加载与对齐评测入口 ReSA/llm/eval_math.py 通过load_data(data_name, test, ../math_data)读取ReSA/math_data/{data_name}/test.jsonl并做两件事若首条样例缺少idx字段则按行序补写idx按idx排序去重。随后prepare_data按--limit截取样本本地脚本默认 512并将输出文件命名为{checkpoint_dir 的 basename}_{save_feature}.jsonl例如DeepSeek-R1-Distill-Qwen-1.5B_resa_0.1_32_local.jsonl存放在{output_folder}/{data_name}/下。2. 题目解析与 Ground Truth 抽取ReSA/llm/utils/math_utils.py 的parse_question对minerva_math走通用分支按question → problem → Question → input的优先级取出题干文本。Ground Truth 的抽取在 ReSA/llm/utils/math_utils.py 的parse_ground_truth中完成minerva_math与math走同一分支if data_name in [math, minerva_math]: gt_cot example[solution] gt_ans extract_answer(gt_cot, data_name)即把solution字段作为官方 CoTgt_cot并调用extract_answer从其中提取\boxed{}内的答案作为标准答案gt。3. Prompt 构造R1 模板与 few-shot 示例ReSA/llm/utils/math_utils.py 的construct_prompt依据args.prompt_type选择模板。由于 ReSA/llm/eval_math.py 检测到 DeepSeek-R1-Distill 检查点时会强制prompt_type r1实际生效的是 ReSA/llm/utils/math_utils.py 中的模板r1: ( Please reason step by step, and put your final answer within \\boxed{{}}. {input}\n\nthink\n, {output}, \n\n, ),当num_shots 0时load_prompt会从 ReSA/llm/utils/math_utils.py 定义的examples[minerva_math]中取前 N 条官方示例拼入 prompt默认num_shots 0即 zero-shot 直答。4. 模型生成与 ReSA 稀疏解码接入生成阶段 ReSA/llm/eval_math.py 先调用create_kv_cache来自 ReSA/llm/arch/model.py创建 KV 缓存再通过model._model_generate执行生成并把 ReSA 的两个核心参数传入生成过程--resa_rec_freq整流频率每隔多少步做一次 dense forward 刷新 KV cache--resa_sparse_ratio稀疏比例block-sparse 注意力保留的 KV 比例。这是 ReSA 论文方法block-sparse 注意力 周期性 dense 整流在数学评测上的实际落地参数。5. 答案抽取与归一化处理 boxed 与特殊格式模型输出在 ReSA/llm/utils/math_utils.py 的extract_answer中按优先级抽取答案其中针对 Minerva 风格的专门处理包括命中final answer is $...$. I hope模式时截取$...$内的内容ReSA/llm/utils/math_utils.py命中boxed时用栈匹配取出\boxed{...}花括号内的内容兜底策略取文本中最后一个数字。抽取结果随后交给strip_string做 LaTeX 字符串归一化。值得注意的是ReSA/llm/utils/math_utils.py 中STRIP_EXCEPTIONS [carp_en, minerva_math]即minerva_math在归一化时跳过单位unit剥离——因为天文/物理类答案本身携带单位语义如cm、ergs/s不能当作噪声删除。同时math_equal支持数值等值含容差is_close与符号表达式等值通过 sympy/latex2sympy 体系两种判定路径保证1.6与\frac{45}{3600}\frac{\pi}{180}7200这类等价答案能正确判对。实战在本地复现 Minerva 数据集的 ReSA 评测步骤 1准备预训练模型参考 ReSA/README.md 的指引用 huggingface-cli 下载模型到本地目录huggingface-cli download deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B \ --local-dir /path/to/pretrained/ \ --local-dir-use-symlinks False步骤 2运行数学评测ReSA/scripts/local_eval_math.sh 提供了开箱即用的评测脚本其中已包含 minerva_math 所需的全部参数export TORCH_IND_SYM_NODE_NO_SYMPY1 cd llm/ torchrun --nproc_per_node1 --nnodes1 --master_port29388 eval.py \ --limit 512 --batch_size 4 \ --checkpoint_dir /path/to/DeepSeek-R1-Distill-Qwen-1.5B --downstream_task math \ --save_feature resa_0.1_32 \ --output_folder /path/to/result/ \ --resa_rec_freq 32 \ --resa_sparse_ratio 0.1需要替换的参数--checkpoint_dir改为实际预训练模型路径--output_folder改为结果保存目录--save_feature本次实验的配置标识会拼入输出文件名如..._resa_0.1_32_local.jsonl--resa_rec_freq/--resa_sparse_ratioReSA 整流频率与稀疏比例可按需调整。脚本执行后会在{output_folder}/minerva_math/下生成按 idx 命名的结果文件。评测过程中 ReSA/llm/eval_math.py 会以save_freq128为粒度分批生成并增量落盘中断后可自动续跑跳过已完成的 idx。由于minerva_math的 R1 生成长度设为 16384且 ReSA/llm/eval_math.py 将max_seq_len上限设为 32768这正好覆盖了 ReSA README 表格中观测到的 6390.8 平均生成长度也解释了为什么该数据集适合检验 ReSA 在超长解码场景下的近无损能力。步骤 3收集并统计结果先安装评测依赖bash scripts/setup_math_eval.sh然后运行结果收集脚本 ReSA/scripts/math_eval_result.shbash scripts/math_eval_result.sh /path/to/output/ file_name其中file_name为结果文件名不含目录例如DeepSeek-R1-Distill-Qwen-1.5B_resa_0.1_32_local.jsonl。脚本内部对minerva_math等任务逐个调用 ReSA/scripts/math_eval_result_length.py该脚本会用LlamaTokenizerFast统计每条回答的 token 长度以 2048 为阈值分别统计短/长回答的准确率与条数调用 ReSA/scripts/math_utils.py 中的evaluate对每条样本计算 acc输出各任务总 acc、阈值分段 acc 与平均长度便于与 ReSA README 中 Dense/Sparse/ReSA 三列进行对比。至此数据 → 生成 → 抽取 → 统计 的闭环全部打通你可以用同一套流程复现 ReSA 论文中 Minerva 一列的数值或在调整--resa_rec_freq、--resa_sparse_ratio后对比 ReSA 配置对大学级定量推理准确率的影响。小结minerva_math是 ReSA 数学评测矩阵中唯一以 MIT OpenCourseWare 真实考题为来源的跨学科大学级数据集其 272 条样本覆盖 9 门课程、全部携带\boxed{}答案标记并通过 ReSA/llm/eval_math.py 与 ReSA/llm/utils/math_utils.py 中的解析、prompt 构造、答案抽取与归一化逻辑无缝接入 ReSA 稀疏解码评测。理解这份数据集的字段约定与消费路径是复现 ReSA 数学推理实验、进一步调优整流频率与稀疏比例的基础。赞分享人工智能大模型预训练深度学习NLP计算机视觉多模态语音【免费下载链接】unilmLarge-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities项目地址https://gitcode.com/GitHub_Trending/un/unilm点击查看免费下载相关推荐OptiScaler 实战指南DLSS、FSR、XeSS 自由切换的完整教程OptiScaler 实战指南DLSS、FSR、XeSS 自由切换的完整教程 OptiScaler 是一款免费开源的图形增强工具。它挂进游戏进程把游戏内部的图形学游戏开发lm-evaluation-harness 中的 AfriMGSM非洲语言数学推理基准的完整评测指南lm evaluation harness 中的 AfriMGSM非洲语言数学推理基准的完整评测指南 导读 AfriMGSM 是 IrokoBench 基准套人工智能模型评测AI 评测Ultravox评测基准自定义数据集测试方法Ultravox评测基准自定义数据集测试方法 Ultravox作为语音AI领域的创新工具其评测体系直接影响模型迭代效率。本文将系统讲解如何使用自定义数据集测人工智能大模型语音音频多模态预训练模型评测创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考