
人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载InferenceX 是一个开源 AI 推理加速器研究平台Open Source AI Accelerator Research Platform用标准化基准衡量大模型推理性能。想为它添加一个新模型或新 GPU 基准你只需要在 inferencex-e2e/configs/ 目录里写好一份 Master YAML 配置。本教程带你从零到提交一步步完成配置、校验与上线全流程。1️⃣ 配置体系总览Master YAML 是唯一事实来源InferenceX 的基准配置全部集中在inferencex-e2e/configs/目录每个文件按硬件平台划分文件用途nvidia-master.yamlNVIDIA GPUH200/B200/B300 等基准配置amd-master.yamlAMD GPUMI355X 等基准配置runners.yaml可调度 runner 标签与集群静态信息ci-priority.yamlCI 作业调度优先级打分CONFIGS.md 官方配置格式参考手册每个配置条目的键名entry-name有约定俗成的格式模型前缀-精度-GPU-框架例如qwen3.5-fp4-b200-sglang。名字起得规范维护者一眼就能看懂你要跑什么。⚠️重点提醒配置由 Pydantic 模型做严格校验见 infx/matrix/validation.py且设置了extraforbid——任何未定义的字段都会直接报错矩阵生成失败。写配置前建议先读一遍 CONFIGS.md。2️⃣ 新条目必写的 6 个核心字段不管加什么基准每个条目都要回答四个问题用什么镜像跑、跑什么模型、在哪台机器上、以什么精度和框架dsr1-fp4-mi355x-sglang: image: lmsysorg/sglang:v0.5.12-rocm700-mi35x # 1. 推理服务容器镜像 model: amd/DeepSeek-R1-0528-MXFP4-Preview # 2. 模型Hugging Face 风格路径 model-prefix: dsr1 # 3. InferenceX 规范模型前缀 runner: mi355x # 4. 目标 runner 标签 precision: fp4 # 5. 精度fp8/fp4/bf16… framework: sglang # 6. 推理框架vllm/sglang/trt…model-prefix是核心系统靠它决定调用 benchmarks/ 下哪个启动脚本。可用的前缀dsr1、dsv4、qwen3.5、kimik3…请查 docs/MODELS.md 的模型支持矩阵。runner必须是 runners.yaml 中labels下已存在的标签比如mi355x、b300或精确集群标签cluster:b200-nscale。3️⃣ 快速上手单节点固定长度基准最常见的场景是fixed-seq-len固定输入/输出长度。以下取自 amd-master.yaml 的真实条目multinode: false scenarios: fixed-seq-len: - isl: 8192 # 输入序列长度 osl: 1024 # 输出序列长度 search-space: # 要扫描的部署配置 - tp: 4 # 张量并行度 conc-start: 4 # 并发起点 conc-end: 64 # 并发终点含 srt-recipe: benchmarks/single_node/srt-slurm-recipes/dsr1/sglang/mi355x-fp4/8k1k.yaml - tp: 8 conc-start: 4 conc-end: 64 srt-recipe: benchmarks/single_node/srt-slurm-recipes/dsr1/sglang/mi355x-fp4/8k1k.yaml几个新手容易踩的坑并发步长固定为 2conc-start: 4到conc-end: 64实际会跑4, 8, 16, …, 64共 6 个点。想跑指定离散并发用conc-list: [10, 66, 548]见 nvidia-master.yaml 中的用法。tp之外还可以选填ep专家并行默认 1、dp-attn数据并行注意力默认 false、pp、dcp-size、pcp-size。目前主流单轮场景是8k1kISL 8192 / OSL 10241k1k 等旧场景已弃用配置前先确认 MODELS.md 的 Scenarios 表别把 GPU 时间花在已退役的场景上。4️⃣ 进阶添加 Agentic Coding 基准如果新模型主打 Agent 工作负载用agentic-coding场景回放真实对话 trace。下面是 nvidia-master.yaml 中 DeepSeek-V4 的一个真实片段节选agentic-coding: - dram-utilization: 0.90 search-space: - { tp: 8, kv-offloading: none, spec-decoding: draft_model, conc-list: [1, 4, 6, 10, 14, 16], srt-recipe: benchmarks/single_node/srt-slurm-recipes/dsv4/vllm/b200-fp4-mtp/agentic.yaml } - { tp: 8, ep: 8, dp-attn: true, kv-offloading: dram, kv-offload-backend: { name: vllm-simple }, spec-decoding: draft_model, conc-list: [32, 64, 96, 128, 160, 192], router: { name: vllm-router, version: 0.1.14 }, srt-recipe: benchmarks/single_node/srt-slurm-recipes/dsv4/vllm/b200-fp4-mtp/agentic.yaml }新增 agentic 基准时注意runner必须写精确的cluster:name标签如cluster:b200-nscale不能写宽泛的 SKU 标签——保证每个搜索点落在同一批硬件上。KV 缓存卸载kv-offloading: dram是可选能力用量受GPU 占比规则约束详见 MODELS.md 的 KV cache offloading policy。router与kv-p2p-transfer只能在顶层或搜索空间条目二选一声明两处都写会被拒绝。按 MODELS.md 的引擎提交策略新模型应优先使用映射的 native/upstream vLLM 或 SGLang 引擎。5️⃣ 多节点与 Prefill/Decode 分离部署需要跨节点部署或 PD 分离disaggregated时把multinode置为true每个搜索点会拆成prefill和decode两个 worker 池multinode: true disagg: true scenarios: fixed-seq-len: - isl: 1024 osl: 1024 search-space: - conc-list: [64] prefill: hardware: b200 # 异构硬件才需要同构可省略 num-worker: 1 tp: 8 ep: 8 pcp-size: 2 decode: hardware: h100 num-worker: 2 tp: 8 dcp-size: 2要点一个 worker 池占用的 GPU 数为num-worker × tp × pp × pcp-size异构配置一边声明hardware要求两边都声明PD 分离条目通常还需要kv-p2p-transfer指明 KV 传输引擎如nixl。6️⃣ Runner 配置告诉调度器去哪台机器跑如果你的新 GPU 集群还没接入先改 runners.yaml在labels下添加标签并列出 runner 名在clusters下声明集群事实gpus-per-node、调度器、Slurm 分区、模型存放卷等。矩阵生成器会从集群记录读取gpus-per-node等字段用于调度计算权威 schema 见 infx/clusters/ 目录。7️⃣ 提交前本地验证别浪费 GPU 机时好消息是不需要 GPU 就能验证配置。矩阵生成器 infx/matrix/generate.py 会加载 master 配置 runners.yaml做完整 Pydantic 校验后输出 JSON 矩阵。按 docs/ci-procedures.md 的做法在inferencex-e2e/目录下uv run --locked python -m infx.matrix.generate test-config \ --config-files configs/nvidia-master.yaml \ --config-keys 你的条目名 \ --seq-lens 8k1k --conc 4 --no-evals退出码为 0 即说明结构与 schema 全部通过。也可以用full-sweep --model-prefix 前缀做过滤式全量生成再用jq length确认生成的任务点数是否符合预期空输出不算通过。8️⃣ 提交清单一次 PR 里都要带上什么✅ 提交新基准的 PR 时请对照以下清单在对应平台的*-master.yaml中新增条目entry-name 遵循前缀-精度-GPU-框架命名在 docs/MODELS.md 的Model support matrix表格加一行模型前缀、日期、激活场景——官方明确要求加模型同一个 PR 里更新这里按 ci-priority.yaml 了解你的条目会被如何排序模型前缀、精度、投机解码都会影响分数结果记录会进入 perf-changelog.yaml该文件有专门的字节/差异/矩阵三重门禁见 infx/workflows/validate_perf_changelog.py。写在最后掌握 Master YAML你就掌握了 InferenceX 的总开关一个文件定义跑什么模型、在哪块 GPU、用什么并行策略与并发扫描范围。建议的路径是先照抄 amd-master.yaml 里最简单的单节点条目 → 本地test-config验证通过 → 再逐步挑战 agentic 与多节点场景。遇到字段报错永远以 infx/matrix/validation.py 的 Pydantic 模型为准——它才是最终的字段契约。祝你顺利跑出自己的第一个 InferenceX 基准点赞分享人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载相关推荐如何为sorry.xuty.tk添加新模板完整教程如何为sorry.xuty.tk添加新模板完整教程 想要为知名的GIF制作平台sorry.xuty.tk添加新的表情包模板吗本教程将为你详细介绍完整的添加流后端音视频MMDeploy项目教程如何为项目添加新模型支持MMDeploy项目教程如何为项目添加新模型支持 引言 在深度学习模型部署过程中我们经常会遇到需要将训练好的模型转换到不同推理引擎的需求。MMDeploy作MMDeploy项目如何为模型部署添加新模型支持MMDeploy项目如何为模型部署添加新模型支持 引言模型部署的挑战与机遇 在深度学习模型开发过程中训练出一个高精度的模型只是成功的一半。将训练好的模型高创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考