scipilot-figure-skill 数据剖析实战:用 profile_data.py 读懂你的实验数据 scipilot-figure-skill 数据剖析实战用 profile_data.py 读懂你的实验数据【免费下载链接】scipilot-figure-skillSciPilot Skills family - Publication-grade scientific figure copilot for Claude Code项目地址: https://gitcode.com/gh_mirrors/sc/scipilot-figure-skill科研画图的第一步往往不是打开 matplotlib而是数据剖析——先搞清楚每列是什么类型、样本量多少、分布偏不偏、有没有小样本陷阱。scipilot-figure-skill 是一个面向科研的出版级数据可视化技能Claude Code Skill它内置的 profile_data.py 脚本能一键把 CSV / Excel / TSV 读进来自动输出列类型、缺失率、分布形态、异常值、分组结构、相关性和初步图型建议。本文带你跑通这个读数据的完整流程。为什么画图前要做数据剖析scipilot-figure-skill 的核心理念是先思考后绘制拿到数据先做探索性数据分析EDA用事实驱动图型选择。它把 8 步工作流排得很清楚——0. 理解任务 → 1. 剖析数据 → 2. 选图 → 3. 查规范 → 4. 配环境 → 5. 绘制 → 6. 自检 → 7. 导出profile_data.py 正是第 1 步的入口。跳过它直接画图很容易踩中几个经典坑每组只有 5 个样本却画了均值柱状图分布全被掩盖数据高度偏态还硬用均值 ± SD误差棒画出负值下限分组维度组合超过 12 种一张图硬塞进去谁也看不懂。这些坑剖析报告都会提前替你拦下来。准备工作安装与依赖先把仓库克隆到本地 Skill 目录git clone https://gitcode.com/gh_mirrors/sc/scipilot-figure-skill \ ~/.claude/skills/scipilot-figure-skill pip install -r ~/.claude/skills/scipilot-figure-skill/requirements.txtrequirements.txt 中剖析脚本真正依赖的只有pandas、numpy和scipy偏度计算都是常规科学计算库几分钟装完。运行数据剖析一条命令出报告假设实验数据保存在results.csv其中group和condition是分组列python scripts/profile_data.py results.csv --group group --group condition三个常用参数说明参数作用source数据文件路径支持 CSV / Excel / TSV--group分组列名可多次指定以形成嵌套/交叉分组--json输出结构化 JSON 而非 Markdown 报告方便程序处理不想指定分组直接python scripts/profile_data.py results.csv也可以报告会少一块分组统计而已。读懂剖析报告的 4 个区块报告是 Markdown 格式包含四个核心区块。逐一看过你对这份数据的体质就心中有数了。区块 1Columns —— 每列的类型与统计列类型nmissingsummaryresponsecontinuous923 (3%)mean35.2, sd12.9, range[0.9, 180], skew0.8 (moderately skewed)groupcategorical9503 levels: A(32), B(33), C(30)daydatetime9502024-01-01 → 2024-03-31notestext950—脚本会把每列识别为 6 种类型之一continuous连续、categorical分类、ordinal有序、datetime时间、boolean布尔、text文本。看完先核对类型识别对不对——比如实验编号 1-10 可能被认成ordinal但你想当分类用需要手动转一下再重跑。连续列还会附上偏度skew和异常值数量IQR 法|skew| 0.5大致对称均值 ± SD 可信0.5 ≤ |skew| 1中度偏态优先中位数 ± IQR|skew| ≥ 1高度偏态必须箱线图/小提琴图考虑对数轴。区块 2Group structure —— 分组样本量- Grouped by: group, condition - Number of groups: 6 - Group size: min1, median3, max3 - **WARN**: at least one group has n3 — statistics unreliable; must show all raw points.这是最关键的预警区。每组 n 直接决定能画什么图每组 n该用什么图不能用什么图n 3直接列每个点dot plot均值柱、箱线、小提琴3 ≤ n 10stripplot / 蜂巢散点均值柱状10 ≤ n 30箱线 叠加 stripplot仅画均值柱严禁n ≥ 30箱线 / 小提琴 / 带误差柱均可—看到n10的 WARN就把图型从均值柱切到箱线 stripplot看到n3直接放弃统计图把每个点列出来。区块 3Correlations —— 相关性 Top 10- response_time ↔ score : r -0.394 (moderate) - age ↔ score : r 0.712 (very strong)按 |r| 降序排列。两个实用价值高度相关的列|r| 0.7互为冗余别让它俩同时占 x 轴和 hue另外 r 排序还能帮你从 20 列里挑出 pairplot 散点矩阵该画的子集。注意 Pearson 只测线性关系r0.1 别急着下无关结论先画散点看一眼。区块 4Warnings Chart suggestions —— 自动提示与初步建议Warnings 区列出所有需要人工决策的问题缺失率超过 20% 的列、出现小样本的类别列每条都附带处理建议。Chart suggestions 区则把数据特征翻译成初步图型有时间列 连续列 → 折线图 误差带1 分类 1 连续且小样本 → 箱线/小提琴 stripplot 叠加原始点2 个连续变量 → 散点图含回归拟合 r 值变量跨数个量级- log axis提示→ 对数 y 轴。⚠️ 报告末尾特意提醒这只是基于数据形态的初步建议最终图型必须结合这张图想论证什么来定——这正是 scipilot-figure-skill 作为可视化顾问与普通画图工具的分界线。从剖析报告到画图决策7 步检查清单 把上面的区块按顺序过一遍就是一次完整的数据剖析看 Columns类型识别对不对错了就修正类型重跑看 Group structure样本量够吗n10 警告 → 切箱线 stripplot看偏度skew 1 → 箱线/小提琴 考虑 log 轴算维度组合组数 × 类别数 12 → 拆图不要硬塞看 Correlations决定散点图的 hue 配置和 pairplot 子集看 Warnings每条都处理掉别默默忽略看 Chart suggestions作为起点结合论证目标做最终决定。详细的逐区块解读和事实 → 决策对照表仓库里有一份专门的解读手册data_profiling.md。下一步按数据形态选图剖析完成只是起点。确定数据长什么样之后就要回答我想表达什么——分布、比较、关系、趋势、构成还是相关性chart_selection.md 提供完整的决策三轴框架和速查表把数据形态与论证意图对上图型就定了。选定之后后续步骤由同目录下的其他脚本接手setup_style.py 配期刊预设和中文字体、export_figure.py 按最终尺寸多格式导出、check_figure.py 投稿前合规自检。完整工作流说明见 SKILL.md。小结用 profile_data.py 做数据剖析本质上是在画图前用 30 秒拿到一份数据体检报告列类型、样本量、偏度、异常值、分组结构、相关性一次跑全小样本警告和图型建议自动给出把最常见的科研画图错误挡在开工之前。数据剖析做扎实了后面的选图、绘制、导出自然水到渠成——这也是 scipilot-figure-skill 先思考后绘制理念的具体体现。【免费下载链接】scipilot-figure-skillSciPilot Skills family - Publication-grade scientific figure copilot for Claude Code项目地址: https://gitcode.com/gh_mirrors/sc/scipilot-figure-skill创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考