Python自动化PTA成绩统计与可视化分析工具开发

📅 2026/8/9 12:54:57
Python自动化PTA成绩统计与可视化分析工具开发
1. 项目背景与需求分析作为一名在高校任教多年的计算机专业教师我深刻理解教学工作中成绩统计的痛点。每次PTA程序设计类实验辅助教学平台作业批改完成后教师需要手动下载成绩表格再用Excel进行繁琐的数据处理。这个过程不仅耗时耗力而且容易出错。这个Python小程序的开发初衷很简单让教师能够一键获取PTA平台的学生成绩数据自动完成统计分析并生成直观的可视化报表。经过三个学期的实际使用迭代目前这个小程序已经能够稳定处理以下核心教学场景自动登录PTA平台并爬取指定课程、指定作业的学生成绩数据计算班级平均分、最高分、最低分、标准差等基础统计指标识别异常分数如抄袭导致的雷同高分或异常低分生成成绩分布直方图和箱线图导出格式化Excel报表供教务存档2. 技术选型与架构设计2.1 为什么选择PythonPython在数据处理和自动化领域具有天然优势requestsBeautifulSoup组合可以轻松处理PTA网页数据抓取pandas提供了专业级的数据处理能力matplotlibseaborn让可视化变得简单跨平台特性方便在不同操作系统的教师电脑上部署2.2 核心模块设计class PTAGrader: def __init__(self): self.session requests.Session() self.df pd.DataFrame() def login(self, username, password): # PTA登录逻辑实现 pass def fetch_scores(self, course_id, assignment_id): # 成绩抓取实现 pass def analyze_scores(self): # 数据分析实现 pass def generate_report(self, output_path): # 报表生成实现 pass2.3 GUI框架选择经过对比测试最终选用PySimpleGUI而非更复杂的Tkinter或PyQt开发效率高适合快速迭代的教学工具内置主题系统无需额外设计UI打包后的exe文件体积小约10MB3. 关键实现细节3.1 PTA登录与会话保持PTA平台采用传统的sessioncookie认证方式需要注意先访问登录页获取csrf_token构造FormData时要包含学校门户的统一认证参数保持会话时需处理PTA的30分钟无操作超时def login(self, username, password): login_url https://pintia.cn/api/sessions headers { Content-Type: application/json, X-Requested-With: XMLHttpRequest } payload { email: username, password: password, remember: True } response self.session.post(login_url, jsonpayload, headersheaders) if response.json().get(user): return True return False3.2 成绩数据抓取优化PTA的成绩表格是动态加载的需要先获取作业列表的API接口/api/exams解析返回的JSON数据中的problemSetId二次请求获取详细成绩/api/exam-submissions重要提示请求频率需控制在5秒/次以上避免触发PTA的反爬机制3.3 异常分数检测算法通过Z-score方法识别异常值def detect_outliers(self): scores self.df[score].values z_scores (scores - np.mean(scores)) / np.std(scores) return self.df[np.abs(z_scores) 2]同时实现相似度检测找出可能存在的抄袭def check_similarity(self): # 使用difflib比对代码相似度 threshold 0.8 suspicious_pairs [] for i in range(len(self.submissions)): for j in range(i1, len(self.submissions)): ratio difflib.SequenceMatcher( None, self.submissions[i][code], self.submissions[j][code] ).ratio() if ratio threshold: suspicious_pairs.append((i,j,ratio)) return suspicious_pairs4. 可视化报表生成4.1 成绩分布直方图def plot_histogram(self): plt.figure(figsize(10,6)) sns.histplot(self.df[score], bins20, kdeTrue) plt.title(成绩分布直方图) plt.xlabel(分数) plt.ylabel(人数) return plt.gcf()4.2 箱线图分析def plot_boxplot(self): plt.figure(figsize(8,6)) sns.boxplot(xself.df[score]) plt.title(成绩箱线图) return plt.gcf()4.3 Excel报表设计使用openpyxl库创建带格式的Excel文件第一页基础统计数据平均分、标准差等第二页详细成绩列表学号、姓名、每题得分第三页异常分数标注红色高亮显示5. 打包与部署实践5.1 使用PyInstaller打包推荐配置pyinstaller --onefile --windowed --iconteacher.ico pta_grader.py常见问题解决打包后找不到matplotlib字体添加--add-datavenv/lib/site-packages/matplotlib/mpl-data;mpl-data杀毒软件误报使用代码签名证书解决5.2 实际使用案例在某数据结构课程中的典型工作流运行程序输入PTA账号密码选择CS101-2023秋季课程勾选实验三 二叉树遍历作业点击分析按钮等待30秒查看自动生成的报告平均分78.5最高分100最低分45检测到3份异常高分相似度90%2名学生分数低于均值2个标准差6. 开发中的经验教训PTA接口变更问题2023年4月PTA更新了API路径导致旧版程序失效。解决方案是增加配置文件中接口URL的可配置项。编码问题部分学生姓名包含生僻字Excel导出时报错。最终采用df.to_excel(writer, sheet_name成绩单, indexFalse, encodingutf-8-sig)性能优化初期处理200人班级数据需要2分钟通过以下改进降至20秒使用lxml替代html.parser将pandas操作向量化禁用matplotlib的交互模式防反爬策略某次连续请求导致IP被封后来增加了time.sleep(random.uniform(3, 8))这个项目给我最大的启示是教学工具开发必须紧跟实际教学需求。现在这个小程序已经在我们教研组内部使用累计处理了超过500次作业批改。如果有老师需要定制功能我通常会建议他们先明确以下几个问题需要统计哪些具体指标如代码相似度检查的阈值报表要包含哪些必要信息如是否显示每题详细得分使用环境有什么限制如学校网络是否开放API访问最后分享一个实用技巧在GUI中添加测试连接按钮可以快速验证PTA账号有效性避免因密码错误导致后续操作失败。这个小功能为用户体验带来了显著提升。