ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

GPT-6 Skill科研实战:6个技能让文献阅读与数学建模效率翻倍

GPT-6 Skill科研实战:6个技能让文献阅读与数学建模效率翻倍 前几天一个同学微信找我说GPT-6都出来了他拿它帮着写论文摘要、改句式速度确实快。但我问他一句话你除了让它写文章还让它干过别的吗他愣了一下反问我那还能干吗这种反应我见太多了。从GPT-4到GPT-6大部分人把AI用得最熟的功能就是“帮我写一段”“帮我润色一下”。不是说这不对但如果你只把它当成一个快一点的打字机那你可能连它真正价值的10%都没用上。尤其是做科研的人天天跟文献、实验、代码、公式打交道这些东西才是GPT-6的Skill功能真正擅长的地方。这篇东西我就把我在科研场景下用得最顺手、也真正跑出过结果的6个Skill挨个讲一遍它们解决什么问题、怎么用、有什么坑。顺带拆一下Skill和普通Prompt到底差在哪以及怎么自己写一个能长期复用的科研Skill。1. 先搞懂GPT-6里“Skill”到底是什么1.1 不是“长提示词”而是封装好的工作流很多人第一次听到Skill这个词第一反应是这不就是一段写得更细的提示词嘛。真不是。一个普通提示词就是你给AI一句话、一个要求它给你一个结果。这个过程中你怎么问、怎么拆解问题、怎么校验答案全凭临场发挥。运气好问得清楚结果靠谱运气不好问得含糊它就给你一堆正确的废话。Skill的逻辑完全不一样。它是一整套封装的、带固定流程的、可复用的能力模块。你用同一个Skill给不同的输入它都会按照预设的方法论一步步执行而不是看起来合理地直接输出一个答案。我举个例子。你直接让GPT-6帮我分析这篇文献它大概率会给你一段笼统的总结什么本文研究了……结果表明……这种话。但如果你加载一个文献速拆Skill它会先定位问题定义、再拆方法创新点、然后核对实验设置、最后给出局限性和可复现性评估。每一步干什么都是定死的输出格式也是统一的。哪怕你换十篇完全不同的论文它走的路子都一致。这就是Skill和Prompt的本质区别Prompt是一次性的对话Skill是一套可沉淀的作业流程。1.2 Skill和Agent的区别很多人傻傻分不清热词里有个高频问题——Skill和Agent到底有啥区别。我也被问过好几次。简单说Agent是一个能自主规划、自己决定下一步做什么的智能体它更像一个实习生会自己看情况办事Skill更像是给实习生用的岗位手册告诉他某类任务应该分成哪几步、每步怎么判断、产出物是什么。Skill是Agent的组成部分但不等于Agent。你可以只装一个Skill手动喂输入、看输出你也可以让Agent自动调度多个Skill。以我自己的使用习惯科研场景下大部分任务并不需要那么强的自主决策一个干得漂亮的Skill就足够了。Agent调多了反而容易出现它自己给自己加戏的情况。搞清楚了这个下面这6个Skill你才能真正用明白。2. 私藏6个科研Skill从读文献到写论文全覆盖先说个前提。GPT-6的Skill生态目前已经相当丰富了你去翻Skill Store各种花活都有有做Nature风格写作的有做仓颉式文字提炼的甚至还有专门给某个测试框架写测试用例的。但真正能扛住科研全流程压力的我个人反复用下来是下面这6个。2.1 文献速拆把60页论文变成一张结构化表格读文献是科研里最费时间、也最让人头大的环节。尤其是刚进组的同学导师甩给你十几篇论文每一篇都厚得像本小册子真读完得熬好几个通宵。文献速拆这个Skill核心逻辑就是四步提取核心问题、拆解方法路径、核对实验证据、评估结论可信度。你只需要把PDF传上去或者把论文文字丢进去它会自动输出一份速拆报告里面包括这篇论文试图解决什么问题一句话版本和三句话版本各一份方法里的关键创新点到底是什么实验数据是否能支撑结论它会把数据来源和关键指标单独列出来作者自己承认的局限和可能的坑如果我要复现这个实验第一优先级需要关注哪几个变量这里有个特别重要的用法它会把每一步都标上原文中的页码或段落编号。一旦你觉得某个判断可疑可以直接翻回原文核对。这一招很关键因为大模型偶尔会自作主张地补全细节有了页码锚点你就不至于被带偏。我用这个Skill读那种二三十页的方法学论文从原来的一下午压缩到半小时。省下来的时间拿去做真正的思考这笔账非常划算。2.2 实验方案架构师从拍脑袋到有章法第二个Skill我愿称之为实验设计急救包。你在做实验之前脑子里那团乱麻丢给它它能帮你理成一张清晰的任务清单。具体来说它会强制你按这套结构走研究假设是什么、自变量有哪些、因变量用什么指标测量、哪些变量必须控制住、实验组和对照组怎么划分、每个组最少需要多少样本。你可能会说这些东西我自己也能想啊。对但问题是你一个人想的时候往往会漏掉几个关键变量或者对照组设计得不够严谨。这个Skill的价值在于它会用一种套路化的流程逼着你把每个环节补齐而不是让你凭直觉糊弄过去。还是得提醒一句它只能帮你把方案结构化样本量计算这种带统计推断的硬核部分最后最好还是用专业的统计软件复核一遍。Skill给你的是一张靠谱的地图但路还是得你自己走。2.3 数学建模与推导校验把公式里的坑提前踩平这个就是热词里被反复提到的数学建模Skill了。做理工科科研的几乎天天跟模型、公式打交道。以前遇到一个复杂方程得手动算半天算了还怕算错现在这个Skill能帮你把整个推导链路走一遍而且最厉害的是它会在关键步骤停下来问一句你确定这个变量是独立的吗。它内置了数学建模竞赛训练出来的那套四段式流程读题、建模、求解、验证。每一步都不会跳一步一步地推给你看。你要是觉得某一步跳了直接要求它展开它会把那一步的变换细节全写出来。有个小技巧分享下我在工程里用它验证过一组流体力学公式推导原本草稿纸要写满两页的化简过程它用符号推导走了一遍最后还真揪出了一个我落掉的二阶小量。这种凭肉眼很难发现的坑它能帮你提前踩平。但别因为它验算得漂亮就全盘照收。凡是涉及量纲一致性边界条件这类物理常识的东西最后一定要自己再扫一眼。AI擅长符号操作但它对这个结果在物理上是否合理的感知力目前仍然不如一个受过训练的人。2.4 代码调试与性能优化甩掉一堆低级Bug科研里写代码跟软件工程里写代码不完全是一回事。科研代码往往写得糙、注释少、模块耦合严重目的就是先跑通再说。这种代码一旦报错排查起来是真的痛苦。代码调试Skill的思路是先复现再定位后修复。它不会一上来就甩给你一大段重写后的完整代码而是先要求你给它报错信息、输入样例和预期的输出然后它自己生成最小复现用例把问题范围缩小最后再给出一个精准的diff补丁而不是让你全盘替换。我自己实测下来的感受是它最擅长处理的场景是这三类数组越界和维度不匹配、类型隐式转换导致的诡异结果、死循环或者极端性能瓶颈。每次它给出的修复建议我都会先看改动涉及了多少行如果改动量特别大那我会更谨慎地检查防止它为了修一个bug引入三个新bug。2.5 数据清洗与可视化把脏数据收拾得明明白白搞科研的都知道实验数据原始状态有多脏。缺值、异常值、单位不统一、时间戳格式混乱光清洗数据就能耗掉你三分之一的项目周期。这个Skill做的事情就是自动检测数据类型、识别缺失值比例、标记可能存在的异常值然后给出一个清洗方案。它不是直接帮你把数据改掉而是把每一个处理动作都列出来告诉你这里做了插值、那里做了剔除为什么这么做。它的原则是可追溯因为科研数据的任何一步改动都会影响后续结论。等到数据干净了你还能让它直接出图。但这里有个使用禁忌让它画图之前一定要先把数据摘要列出来给它看你看一眼分布是否合理再让它出图。否则模型会画得很漂亮但坐标轴刻度、配色、图例可能都暗藏问题放在论文里是要被审稿人挑刺的。2.6 论文成稿与盲审模拟写完了还能换个角度掐自己最后一个Skill不是帮你写得快而是帮你想得明白。写完初稿之后你沉浸在自己的逻辑里太久很多毛病根本看不见。我会把论文丢给这个Skill让它切换到三个视角来挑刺作者视角这段推导跳步了吗实验描述是否足够让读者复现审稿人视角创新点充分吗对比实验够不够有没有过度声称结论一般读者视角引言能让人看懂研究动机吗图表自己会说话吗每次跑完这个盲审模拟我都能被它挑出一堆问题有些是真问题有些是它想多了但你多了一套客观反馈改起来就有方向感了不是对着屏幕发呆。网上的确有人拿它做Nature风格仿写那属于风格范畴学术写作的底线——数据真实、分析严谨——还是得自己守住。3. 实战把数学建模Skill用在食堂排队优化上顺着2.3接着往下聊光讲Skill能用还不行我给你一个完整的实战过程你照着操作一遍就能找到感觉。3.1 开始前的准备我用一个非常经典的排队论问题来演示假设学校食堂窗口数量固定学生到达规律服从某分布想找到一个最优窗口数让平均排队时间控制在3分钟以内。以前要做这事你得去翻《运筹学》教材里的排队论公式然后推导、查表、写仿真代码。现在这套东西数学建模Skill可以一条龙帮你走完。第一步你得先把自己的输入组织好。这个Skill的输入模板是这样的问题描述如果你的问题需要明确目标、约束和可调参数已知条件学生到达率、平均服务时间、每个窗口的服务速率约束条件窗口数量有限、预算有限等期望输出最优窗口数建议、平均排队时长预测、配套仿真代码3.2 在GPT-6中加载Skill并处理实际问题加载Skill后我把上面这份输入直接丢进去。它做事情很有条理第一段它把问题场景重新梳理了一遍明确了关键变量比如到达率λ、服务率μ、窗口数c确认了排队论模型中的M/M/c假设。它主动提醒如果到达时间不满足泊松分布结果需要重新评估。第二段它把理论公式摆了出来推导了平均等待时间Wq的表达式并代入了我给的参数值。第三段它给出了一个数值求解的过程把不同窗口数下的平均排队时间列成了一张对比表。最后它给出一段Python仿真代码用随机数模拟了食堂高峰期的排队情况跑完以后告诉我在窗口数为5的时候平均排队时间能压到2分45秒左右6个窗口可以降到2分10秒但边际收益急剧下降所以5个窗口是最优解。整个流程下来不到五分钟。如果我自己推导加写仿真少说半天。3.3 复盘哪个环节出力最大我个人体会这个Skill出力最大的环节不是求解而是建模。在它主动追问到达时间是否满足泊松分布的那一刻你就能感受到它不像一个只会套公式的计算器更像一个有建模经验的助手在提醒你留意假设边界。这种对条件敏感的判断正是科研里最需要养成的习惯。另外提醒一句最终报告里的参数建议仍然需要你用实地调研数据去校准。Skill解决的是方法论真实数据才是你论文的地基。4. 自己开发一个科研Skill其实没那么玄热词里有一批人天天找Skill脚本Skill开发的资料其实这个东西没有那么神秘。我给一个最简单的开发框架。4.1 Skill的核心结构不管什么平台上的Skill本质上就三个要素触发条件、执行流程、输出格式。你可以把它们写在一个简单的描述文件里。举个例子我做了一个给自己用的实验记录摘要Skill逻辑很简单name: experiment_log_summarizer description: 将零散的实验记录整理成结构化摘要 instructions: | 1. 先读取用户提供的原始实验记录 2. 按日期、实验目的、操作步骤、观察结果、异常记录、下一步计划六个字段归档 3. 对任何用户未明确写出的信息进行标注不擅自推测 4. 最终输出为一张Markdown表格方便直接存档 input_template: raw_log: 粘贴你的实验记录原文看到没有它做的事情就是把方法固化下来。你在日常使用中如果把一些我每次都问同样问题的场景整理成这样的描述文件你就在开发自己的Skill了。4.2 一个好Skill的判断标准我做了一段时间Skill开发之后总结出来三个判断标准第一执行链路是确定的。同一个Skill在不同时间跑同一个输入产出的结构应该高度一致而不是每次格式都飘忽不定。第二具备主动的边界检查。就是刚才排队论例子里的那种追问——你这个条件满足XX假设吗如果Skill只会无条件执行那是工具会主动追问假设边界的才是合格的方法论。第三输出有可追溯性。好Skill给出的结果一定能让用户溯源到原始输入或者原始文献而不是拍脑袋编一个答案。任何把编造当创造的Skill在科研场景下都是毒药。4.3 从0到1快速写Skill的三步法如果你现在就想动手写一个我建议按这三步走。第一步选定场景。找一个你每周都要做、但每次都重复提问的任务比如把实验结果整理成图注给推演过程查漏。第二步把最优流程拆出来。回想一下你平时遇到这个任务是怎么一步步处理到最好的。把这些步骤用文字写下来越具体越好。第三步写进Skill描述文件并测试。先拿三个不同的输入测试看输出是否稳定。如果某次输出崩了回到指令里补约束条件。我给你列一个模板你直接抄就行给Skill起一个直白的名字别整花活描述里写清楚这个Skill适合处理什么、不适合处理什么指令部分用有序列表分步写每步一句别啰嗦在最后加一行如果输入信息不足输出前先列清缺失项你把这三步走完你就拥有自己的Skill了。未来在GPT-6上干活你的效率会和其他人拉开档次。5. 常见问题与排查技巧实录Skill这个东西虽然好用但也不是每次跑起来都顺畅。我踩过不少坑整理了几类特别典型的问题和排查思路。5.1 Skill不生效怎么办很多人加载了Skill发现GPT-6回答的内容跟没加载一样。这种时候先别急着骂平台先做三件事第一检查触发词。有些Skill需要特定指令才会激活你如果直接用大白话提问它可能根本没进入Skill模式。第二确认上下文长度。如果你的对话历史特别长Skill加载的部分可能被截断了重新开一个会话再试。第三查看Skill版本。某些第三方Skill更新非常频繁你用的是否是最新版会直接影响行为表现。实在不行直接换个相似功能的试试。5.2 生成结果跟专业文献对不上这个问题的根源大概率是模型在识别你上传的文献时存在偏差。我的排查方法是要求Skill先复述它从文献里提取的关键信息比如假设、方法、实验条件确认它理解对了再做后续分析。如果复述环节就和原文对不上那就重新上传或者换一种文件格式。比如PDF扫描版经常出现文字错乱我会先把PDF转成文本再喂给Skill准确率能提升一大截。5.3 代码或推导卡在死循环里数学推导或者代码调试时偶尔会遇到模型在某一步不停打转给了好几个方向都走不通。这种情况我一般用两招第一招强制中断让它把当前假设全部列出来然后问一句这些假设里面有没有哪个是你想当然加上的第二招换一个参考点。比如让它从最终结论反推把目标公式写出来然后倒着往前补推导过程。很多卡壳问题一旦换个方向就通了。5.4 心态避坑Skill不是万能的最后说一句大实话Skill再强也不能替代你对领域的判断力。它也许能帮你把公式推得漂亮、把代码写得利落但这个方向值不值得做这个结论有没有意义这种问题永远要由你来回答。你把它当高级工具它就是你的杠杆你把它当权威它反而会变成你的天花板。6. 写在最后的一点体会之前有人问我GPT-6到底会不会颠覆科研。我的答案一直是工具不会颠覆科研会用工具的人才会。Skill这个功能最奇妙的地方在于它把你过去积累的方法论和模型的计算能力粘在了一起。你不需要把每一次干活的经验都记在脑子里你只需要把它沉淀成一个Skill下次直接调用就行了。我个人现在的工作习惯是给每个常规科研任务配一个专属Skill。文献阅读配速拆实验设计配架构师数据处理配清洗代码调试配诊断。每个Skill平时安安静静躺在列表里需要的时候一键唤醒干完活就退场。这种感觉很踏实像给自己招了一整个科研助理团队。最后再送一个使用技巧你下次拿到一个陌生领域的论文第一件事不要让它总结而是加载文献速拆Skill让它按那套固定流程走一遍。你会发现那种无从下手的感觉会立刻消失哪怕你再不熟悉这个领域你也有了一张能照着走的地图。GPT-6都来了别再只用一个聊天框写文章了。你的科研工作里到处都用得上Skill。挑一个场景把这篇文章里的方法套进去跑一次你会回来感谢我的。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进