用AI自动生成pandas代码:自然语言转Python数据分析师

📅 2026/8/16 2:30:35
用AI自动生成pandas代码:自然语言转Python数据分析师
前言如果你每天都在用pandas做数据分析你大概也经历过这样的场景明明知道自己想做什么操作却记不清具体的API语法于是在文档里翻来翻去。“是.agg()传字典还是传列表”“滚动平均是.rolling()然后.mean()吗窗口参数叫什么”“seaborm画相关系数热力图的一行代码是什么来着”每次查文档2-5分钟一天查30次就是一个小时——不是花在分析上是花在记语法上。我做了什么一个工具用英语描述你想对数据做什么操作它返回语法验证过的、可以直接复制粘贴的pandas代码。输入示例Group sales by month, calculate total revenue and average order size生成输出df[month]df[date].dt.to_period(M)resultdf.groupby(month).agg(total_revenue(revenue,sum),avg_order_size(order_size,mean)).reset_index()注意它自动处理了datetime转换——这种细节第一次写很容易漏然后debug 10分钟。工作原理三个组件没有黑魔法1. Few-shot示例22个精选模式系统提示词包含22个示例覆盖开发者真正常用的模式groupbyagg、merge/join、datetime处理、字符串操作、缺失值处理、pivot、可视化、分箱、过滤、链式调用。这不是通用的LLM包装——是专门针对pandas优化的。2. Schema感知上传CSV或描述你的列生成器就知道df[date]是datetime类型df[user_id]是字符串。不再有假设列X存在的占位符问题。3. AST语法验证返回代码前用ast.parse()检查语法错误。如果模型幻觉出一个不存在的方法验证器会标记出来。你永远不会拿到有语法错误的代码——同时还会扫描危险操作eval、exec、subprocess、os.remove。更多示例滚动平均Calculate the 7-day rolling average of the close price columndf[rolling_avg]df[close].rolling(window7).mean()合并冲突处理Merge orders and customers on customer_id, keep only matching rowsmergedpd.merge(orders,customers,oncustomer_id,howinner)分位数分箱Create quartile bins for income and label them Q1 through Q4df[income_quartile]pd.qcut(df[income],q4,labels[Q1,Q2,Q3,Q4])相关系数热力图Create a heatmap of the correlation matrix with annotationsimportseabornassns sns.heatmap(df.corr(numeric_onlyTrue),annotTrue,cmapcoolwarm)它不是什么诚实地说明边界它不是黑盒分析师。它生成代码你需要阅读和验证。df.groupby(date)[revenue].sum()不管是否回答了你的问题都能运行。它不了解你的数据。它不知道revenue列的单位是分还是元也不知道null代表不适用还是零。领域知识仍然是人的。它不处理复杂的多步管道目前。2-3步的组合效果不错。10步的探索性分析还是你的工作。诚实的价值主张它节省了20-30%花在语法查询上的时间让你把时间花在真正重要的70-80%上——理解你的数据和解读结果。技术栈后端Python FastAPI可插拔的LLM providerOpenAI / Anthropic / Ollama / stub前端React Vite语法高亮自然主题UI验证ast.parse() 危险操作扫描限流免费层每IP每天5次查询试试看免费层每天5次查询不需要注册→PandasAI — 在这里试试用英语输入一个数据操作拿到验证过的pandas代码。如果你发现有处理得好或不好的模式欢迎评论告诉我。我最关心的边界情况它能处理你真实世界的混乱数据任务还是只能处理干净的示例用你今天正在做的事情试试然后告诉我结果。