此文章为本人亲自指导加编写,禁止任何人抄袭以及各类盈利性传播, 相关的代码+部署+论文+ppt+代码讲解+答辩指导文件都有可私
计算机专业毕业设计任何项目-程序-论文-想单独指导的可以私
摘 要
针对大学生课堂行为分析中人工观察效率低、实时性差等问题,本文提出一种基于YOLOv11的大学生课堂状态分析系统。通过自动识别听讲、书写、使用手机等典型行为,为教学评估与课堂管理提供数据支撑,助力提升教学质量。
系统首先采集多场景课堂视频,构建标注图像数据集并采用数据增强扩充样本;其次以YOLOv11为基础,引入注意力机制、优化损失函数,并利用模型剪枝与量化实现检测速度与精度的平衡;最后结合时序分析消除误检,开发可视化系统,实现课堂专注度统计、行为分布展示及异常预警。
实验结果表明,该系统在密集遮挡场景下行为识别准确率显著提升,推理速度满足实时分析需求。可视化界面支持教师实时查看状态概览与课后数据回溯,为教学优化提供了有效的数据依据。
关键词:YOLOv11;图像采集;数据清洗;大学生课堂状态分析
Abstract
In response to the problems of low efficiency and poor realtime performance in manual observation of college students' classroom behavior analysis, this paper proposes a college student classroom state analysis system based on YOLOv11. By automatically identifying typical behaviors such as listening, writing, and using mobile phones, data support is provided for teaching evaluation and classroom management, helping to improve teaching quality.
The system first collects multi scene classroom videos, constructs a annotated image dataset, and uses data augmentation to expand the samples; Secondly, based on YOLOv11, attention mechanism is introduced, loss function is optimized, and model pruning and quantization are used to achieve a balance between detection speed and accuracy; Finally, by combining time series analysis to eliminate false positives, a visualization system is developed to achieve classroom focus statistics, behavior distribution display, and abnormal warning.
The experimental results show that the system significantly improves the accuracy of behavior recognition in dense occlusion scenes, and the inference speed meets the requirements of realtime analysis. The visual interface supports teachers to view realtime status overview and post class data backtracking, providing effective data basis for teaching optimization.
Keywords: YOLOv11; Image acquisition; Data cleaning; Analysis of Classroom Status of College Students
目 录
第1章 前 言
1.1研究背景
随着高等教育规模的持续扩大,课堂教学质量的监测与评估面临日益严峻的挑战。传统的课堂状态分析主要依赖人工观察、随堂记录或课后问卷调查,不仅耗时费力,而且存在主观性强、样本量有限、无法实时反馈等缺陷[1]。近年来,计算机视觉与深度学习技术的快速发展,为教育行为分析提供了全新的技术路径。尤其是基于目标检测的行为识别方法,能够在非侵入式条件下自动捕捉学生的头部姿态、手部动作等细微行为特征,实现对课堂专注度的量化评估[2]。YOLO系列模型凭借其端到端、高实时性的优势,在行为检测领域得到广泛应用。YOLOv11作为该系列的最新迭代,引入了C3k2模块、C2PSA空间注意力机制以及优化的BiFPN特征融合结构,在保持检测速度的同时显著提升了精度。然而,大学课堂场景中学生密集排列、相互遮挡严重、光照条件多变、姿态复杂多样,通用目标检测模型直接应用往往效果不佳。因此,构建面向大学课堂场景的行为数据集,并基于YOLOv11进行针对性模型优化,开发具备时序分析与可视化功能的课堂状态分析系统,具有重要的现实必要性与技术可行性[3]。
针对大学课堂场景中学生行为的视觉检测,现有研究仍存在明显局限。一方面,通用行为识别数据集(如COCO、OpenPose)主要面向日常动作或人体关键点检测,缺乏对“抬头听课”“低头书写”“侧身交谈”“举手提问”等课堂特定行为的精细标注,且多数数据采集自实验室环境或单视角摄像头,难以反映真实阶梯教室中学生的密集分布与姿态多样性。另一方面,基于OpenPose或HRNet的人体骨骼关键点方法虽能捕捉头部朝向与躯干姿态,但在严重遮挡(例如前排学生遮挡后排头部)情况下容易出现关键点缺失或漂移,且计算开销较大,难以在普通教学设备上实现多路实时分析。YOLOv11作为新一代单阶段检测模型,在架构上进行了三项关键升级:C3k2模块通过跨阶段局部连接与多分支卷积增强梯度流,改善了小尺度目标(如后排学生的微小头部变化)的特征表示;C2PSA空间注意力机制能够在特征图层面自适应加权,使模型聚焦于人体活动区域而抑制讲台、黑板等背景干扰;优化的BiFPN融合结构则更高效地整合多尺度特征,有助于区分相邻学生的重叠边界。这些特性使得YOLOv11相比于YOLOv8或v9,在密集人群行为检测任务中有望实现更高的精度与更低的漏检率,为大学课堂专注度分析提供了可靠的技术基座[4]。
基于上述分析,本文拟设计并实现一套基于YOLOv11的大学课堂学生行为分析系统。系统整体划分为离线训练与在线分析两个阶段。离线阶段首先针对真实阶梯教室的多摄像头视角,采集不同光照(上午、下午、阴天)、不同课程类型(大班讲授、小班研讨)的视频素材,经帧采样后使用多边形标注工具对每个学生的头部边界框及行为类别(专注、低头、举手、瞌睡、侧向交谈)进行精细化标注,构建规模不少于5万帧的高质量课堂行为数据集。同时采用随机擦除、MixUp、马赛克增强等手段模拟真实遮挡与光照变化,提升模型泛化性[5]。在线分析阶段,系统接入教室已有的网络摄像头,调用经TensorRT加速的YOLOv11检测模型逐帧推理,输出每个学生的位置与行为类别;为消除单帧误检并捕捉行为时序演变,系统集成轻量级跟踪算法(如ByteTrack)实现对学生个体的长时间轨迹关联,并基于滑动窗口计算每一学生的“专注时长占比”“异常行为频次”等量化指标[6]。最终,系统以热力图、行为时序曲线、重点学生预警等形式在前端可视化展示,同时将统计数据推送至教师终端或教务管理平台,实现课堂质量的实时反馈与教学改进辅助。该系统的落地应用,有望改变传统课堂评估依赖主观经验或课后追忆的被动局面,为高等教育质量监测提供客观、高效、可复现的技术工具。
1.2研究意义
本系统的研究意义在于:首先,能够有效解决传统人工课堂观察效率低下、主观性强的问题,通过自动化、标准化的行为识别与统计,为教师提供客观、实时的课堂专注度分布与异常行为预警,帮助教师及时调整教学策略,提高课堂互动效果。其次,系统可对整门课程或整个学期的学生行为数据进行长期积累与趋势分析,揭示不同教学环节、不同时间段学生的注意力变化规律,为教学改革、课程设计优化提供数据驱动的决策依据。再者,对于学校教学管理部门而言,该系统可以低成本、大规模地完成对多个教室课堂状态的同步监测,取代传统督课人员的随机抽查,提升教学督导的科学性与覆盖面。此外,系统生成的行为热力图、专注度时序曲线等可视化结果,能够直观反馈学生的参与程度,有利于激发教师的教学反思意识,促进以学生为中心的课堂生态建设。最后,该研究探索了YOLOv11在密集遮挡、姿态多样场景下的模型改进策略,所积累的数据集与优化方法可为人脸检测、行为识别等相关领域的研究提供参考,推动计算机视觉技术在教育场景中的落地应用[7]。
从学生个体发展与教育公平的视角看,本系统也具有不可忽视的社会价值。大学课堂中,部分性格内向或基础薄弱的学生往往在注意力涣散时不愿主动表露,而教师受限于班级规模难以逐一关注。本系统通过对学生头部姿态、手部动作等非言语行为的持续量化分析,能够识别出长期低头、频繁侧向交谈或瞌睡等低专注模式,并以匿名的预警信号提醒教师对相关学生进行课后沟通或学业帮扶,从而在保护学生隐私的前提下实现早期干预,避免学业滑坡。同时,系统积累的个体行为轨迹可用于挖掘不同类型学生的注意力变化规律,例如对比前排与后排学生、不同性别或不同专业学生的课堂参与度差异,为优化座位编排、调整授课节奏提供依据。对于教育资源相对薄弱的院校,该系统采用普通网络摄像头即可部署,无需穿戴设备或昂贵的眼动仪,硬件成本低,算法模型经过轻量化后能在边缘计算设备上实时运行,使得大规模推广成为可能。这有助于缩小不同学校之间课堂质量监测能力的技术鸿沟,推动教育评价从“结果导向”向“过程导向”转变,为每一位学生创造更加公平、可监督的学习环境。
在技术方法论与跨学科融合层面,本系统的研发也具有积极的示范效应。当前计算机视觉研究多聚焦于通用目标检测或行人再识别,针对教育场景中“密集排列、半遮挡、微小姿态变化”等特殊挑战的公开数据集和优化策略依然匮乏。本研究将构建首个面向大学阶梯教室的真实场景行为数据集,包含多视角、多光照、多课程类型的精细化标注,填补领域空白[8]。基于YOLOv11的改进策略——例如针对遮挡问题设计的注意力引导特征重标定、针对小尺寸头部检测的多尺度融合增强,以及结合时序滑动窗口的行为稳定性判定方法,均可迁移至其他密集人群分析任务(如地铁乘客行为监测、大型集会安全预警等),具有广泛的技术外溢效应。此外,系统输出的专注度热力图、行为时序曲线与教学事件(提问、板书、播放视频)的关联分析,将教育学的质性观察与计算科学的定量建模有机结合,开辟了“教育数据挖掘”与“计算机视觉”交叉研究的新范式。后续研究者可基于本系统开源的数据与代码,进一步探索情感计算、姿态估计与课堂语义理解等更高阶任务,推动人工智能技术真正服务于“以学生为中心”的智慧教育生态构建。
1.3国内外现状分析
国内学者在课堂行为分析方面已开展大量研究。早期工作多基于传统图像处理或浅层机器学习方法,如利用HOG特征结合SVM分类器识别举手、阅读等行为,但在复杂教室环境下鲁棒性较差。随着深度学习兴起,基于卷积神经网络(CNN)的行为识别逐渐成为主流。张等人(2022)使用Faster RCNN对中学课堂中的听讲、玩手机等行为进行检测,取得了较好效果,但检测速度难以满足实时需求。为兼顾精度与速度,不少研究者转向YOLO系列模型。李等[9](2023)基于YOLOv5构建了大学生课堂行为检测系统,在自建数据集上mAP达到87.6%,但在密集遮挡场景下漏检率较高。随后,王等(2024)引入注意力机制改进YOLOv7,提升了小目标行为的识别能力。针对时序信息利用,陈等(2023)利用LSTM网络对连续帧行为进行平滑,有效减少了单帧误检。然而,现有研究大多针对中学或小型教室,真正面向大学阶梯教室、多角度光照变化环境的高质量数据集仍较匮乏。同时,多数工作停留在模型检测层面,缺少完整的状态统计分析及可视化系统。此外,尚未见到基于最新YOLOv11框架进行大学生课堂行为分析的研究报道。因此,本研究基于YOLOv11的优势并结合时序分析机制,有望填补当前研究的不足。
国外在教育行为感知领域起步较早,研究涵盖课堂注意力估计、学生参与度自动评估等多个方向。早期,Raca等人(2015)利用头部姿态估计和眼动跟踪判断学生注意力,但依赖特殊硬件设备,难以大规模部署。随后,基于计算机视觉的无接触式方法受到关注。Thomas[10]等人(2019)使用OpenPose提取学生骨架关键点,通过姿态变化识别听讲、书写、交谈等行为,模型泛化能力较强,但对遮挡敏感。在目标检测方面,YOLO系列被广泛采用。Tan等人(2021)在小学课堂场景下对比了YOLOv3与SSD,发现YOLOv3在处理快速动作时更具优势。近年来,随着YOLOv5、v8等版本的出现,研究重点转向轻量化与实时性。Johnson等人(2023)基于YOLOv8开发了课堂行为分析系统,实现了对20名学生同时检测的平均帧率约35 FPS。针对时序一致性,一些研究采用时序卷积网络(TCN)或Transformer对行为序列建模。例如,Gupta等人(2024)将YOLO检测结果输入到视频Transformer中,显著提升了复杂场景下行为识别的准确性。在公开数据集方面,国外的Classroom Attention Dataset(CAD)和DAiSEE数据集提供了部分标注行为,但前者样本规模有限,后者主要面向情感识别。总体而言,国外研究虽技术手段丰富,但专门针对大学课堂密集人群、多种干扰条件下的系统研究仍不充分,且大多未引入YOLOv11的最新技术优势。本研究基于YOLOv11并融合C2PSA注意力等创新模块,有望在性能上超越现有方法。
国外在教育行为感知领域起步较早,研究涵盖课堂注意力估计、学生参与度自动评估等多个方向。早期,Raca等人(2015)利用头部姿态估计和眼动跟踪判断学生注意力,但依赖特殊硬件设备,难以大规模部署。随后,基于计算机视觉的无接触式方法受到关注。Thomas等人(2019)使用OpenPose提取学生骨架关键点,通过姿态变化识别听讲、书写、交谈等行为,模型泛化能力较强,但对遮挡敏感。在目标检测方面,YOLO系列被广泛采用。Tan等人(2021)在小学课堂场景下对比了YOLOv3与SSD,发现YOLOv3在处理快速动作时更具优势。近年来,随着YOLOv5、v8等版本的出现,研究重点转向轻量化与实时性。Johnson[11]等人(2023)基于YOLOv8开发了课堂行为分析系统,实现了对20名学生同时检测的平均帧率约35 FPS。针对时序一致性,一些研究采用时序卷积网络(TCN)或Transformer对行为序列建模。例如,Gupta等人(2024)将YOLO检测结果输入到视频Transformer中,显著提升了复杂场景下行为识别的准确性。在公开数据集方面,国外的Classroom Attention Dataset(CAD)和DAiSEE数据集提供了部分标注行为,但前者样本规模有限,后者主要面向情感识别。总体而言,国外研究虽技术手段丰富,但专门针对大学课堂密集人群、多种干扰条件下的系统研究仍不充分,且大多未引入YOLOv11的最新技术优势。本研究基于YOLOv11并融合C2PSA注意力等创新模块,有望在性能上超越现有方法。
1.4研究内容
本研究的主要内容包括:第一,构建面向大学课堂场景的行为数据集。采集多角度、多光照条件下的课堂教学视频,选取听讲、书写、举手提问、使用手机、趴桌睡觉、交头接耳六类典型行为,对图像中的学生目标进行精确标注,并采用数据增强技术扩充样本规模。第二,基于YOLOv11进行行为检测模型优化。以YOLOv11为基础框架,引入注意力机制增强关键行为特征提取能力,优化损失函数处理类别不平衡问题,并通过模型剪枝与量化实现检测速度与精度的平衡,以适应课堂密集遮挡、姿态多样的复杂环境。第三,设计课堂状态时序分析与可视化系统。结合连续帧间行为状态的时序关系,设计状态判别机制消除单帧误检,实现对课堂整体专注度、行为分布、异常行为预警等指标的统计与分析,并开发可视化界面,以图表、热力图等形式直观呈现分析结果,支持教师实时查看课堂状态概览及课后数据回溯,为教学优化提供数据依据。。
第2章 基于YOLOv11的大学生课堂状态分析的理论基础
2.1目标检测技术基本原理
目标检测是计算机视觉领域的核心任务之一,旨在从图像或视频中定位出感兴趣的目标对象,并识别其类别。与图像分类不同,目标检测不仅需要判断图像中是否存在某类物体,还需输出每个目标的边界框位置及其置信度。根据技术发展脉络,目标检测方法主要分为两大流派:传统目标检测算法与基于深度学习的目标检测算法。
传统目标检测算法通常采用“区域选择+特征提取+分类器”的框架。区域选择常用滑动窗口或选择性搜索策略,在图像上生成大量候选区域;特征提取依赖人工设计的特征描述子,如HOG(方向梯度直方图)、SIFT(尺度不变特征变换)、LBP(局部二值模式)等;分类器则使用SVM(支持向量机)、AdaBoost等机器学习模型。该类方法在简单场景下具有一定效果,但存在候选框冗余度高、特征表达能力有限、难以应对遮挡与光照变化等缺陷,难以满足复杂课堂环境下学生行为检测的精度与实时性要求[12]。
基于深度学习的目标检测算法自2012年AlexNet在ImageNet竞赛中取得突破后迅速发展,现已成为主流方法。依据检测流程的不同,可将其分为两阶段检测器和单阶段检测器。两阶段检测器(如RCNN系列)首先生成候选区域,再对每个区域进行分类与回归,检测精度高但速度较慢;单阶段检测器(如YOLO系列、SSD)直接在图像网格上预测边界框和类别,无需独立区域生成步骤,实现了端到端的实时检测。其中,YOLO系列将目标检测任务统一为回归问题,通过单个卷积神经网络同时预测多个目标的类别和位置,凭借其极快的推理速度和优异的精度,在实时应用场景中占据主导地位。本研究选用YOLOv11作为基础模型,正是基于其在实时性与准确性之间的出色平衡。
2.2基于YOLOv11的大学生课堂状态分析的模型结构
YOLOv11是YOLO系列目标检测算法的较新迭代版本,在继承YOLO系列“统一回归”核心理念的基础上,对网络结构进行了多项创新优化[3]。针对大学生课堂状态分析场景中学生密集、相互遮挡严重、姿态多样等特点,YOLOv11通过引入C3k2模块、C2PSA空间注意力机制以及优化的BiFPN特征融合结构,显著提升了模型对微小行为特征和复杂上下文信息的捕捉能力。本节详细阐述YOLOv11的整体模型结构及其在课堂行为检测中的适配性。
YOLOv11的网络主要由输入端(Input)、骨干网络(Backbone)、颈部网络(Neck)和检测头(Head)四部分组成。输入端负责对原始课堂图像进行预处理,包括自适应图像缩放、Mosaic数据增强和自适应锚框计算等操作,以适应不同分辨率和宽高比的输入。骨干网络负责从输入图像中提取多层次、多尺度的特征图,YOLOv11采用改进的CSPDarknet结构,并在其中集成了C3k2模块。C3k2模块是对原有C3模块的升级,通过引入分组的卷积结构和跨阶段局部连接,在降低计算量的同时保留了更丰富的梯度信息,有效增强了网络对听讲、书写等细微动作的感知能力[14]。此外,骨干网络中嵌入了C2PSA(Crossstage Partial with Spatial Attention)空间注意力机制,该机制对特征图的空间维度进行加权,使模型能够聚焦于学生头部、手部等关键行为区域,抑制背景和无关干扰,从而缓解课堂密集遮挡带来的定位困难问题。
颈部网络采用改进的双向特征金字塔网络(BiFPN)结构。传统的FPN只能实现自顶向下的特征融合,而BiFPN引入自底向上的额外路径,并对不同层级的特征赋予可学习的权重,从而实现更高效的多尺度特征融合。在课堂场景中,不同距离的学生在图像中呈现的尺度差异较大——前排学生目标较大,后排学生目标较小且易被遮挡。BiFPN能够有效融合高分辨率细节特征与低分辨率语义特征,使得模型同时对大目标和小目标保持较高的检测灵敏度[15]。检测头部分,YOLOv11采用解耦头结构,将分类任务与回归任务分离,各自使用独立的卷积分支,避免了相互干扰,提升了收敛速度和检测精度。最终,模型输出每个学生目标的边界框坐标、行为类别置信度以及行为类别标签,如听讲、书写、使用手机、趴桌睡觉等。
为适应大学生课堂状态分析的实时性需求,YOLOv11支持模型剪枝与量化技术。通过移除冗余通道和降低权重精度,可以在保持检测精度基本不变的前提下显著减小模型体积并提升推理速度,使其能够在普通计算设备上实现对多路课堂视频流的实时处理。
2.3技术综述
2.3.1 行为识别技术
行为识别旨在从视频或图像序列中识别出人体的动作或行为,是实现课堂状态自动分析的核心技术。传统方法基于手工特征(如时空兴趣点、密集轨迹)结合隐马尔可夫模型或条件随机场进行行为分类,但对复杂动作和遮挡鲁棒性差。随着深度学习的发展,行为识别可分为基于RGB图像的方法和基于骨架的方法。基于RGB图像的方法使用3D卷积神经网络(如C3D、I3D)或双流网络(空间流+时间流)提取时空特征,检测精度较高但计算开销大[16]。基于骨架的方法利用姿态估计(如OpenPose、HRNet)提取人体关键点,再通过图卷积网络(GCN)或时序循环网络进行分类,对背景变化不敏感,但对关键点检测的准确性依赖较强。在课堂场景中,由于学生数量多、相互遮挡严重,基于骨架的方法往往难以稳定提取关键点,因此基于目标检测的行为识别(即直接检测学生身体区域并分类行为)更为实用。本研究采用的YOLOv11属于此类,能够在端到端框架下同时完成定位与分类,兼顾效率与效果。
在上述行为识别方法的分类体系中,基于RGB图像的目标检测式行为识别与课堂场景的适配性最为突出。大学阶梯教室中,学生密集落座于连排桌椅,身体大部分区域被桌面和前排椅背遮挡,仅头部、肩部及上肢小范围可供观测。基于骨架的方法需要完整的人体骨骼拓扑(如鼻子、肩膀、手肘、手腕等17个关键点),但侧后方或严重遮挡时,姿态估计算法极易出现关键点缺失或错误连接,导致行为分类准确率断崖式下降。而基于3D卷积或双流网络的方法虽然能建模时序运动信息,却需要连续多帧的密集计算,在同时分析60名以上学生的实时场景中,通常仅能处理1–2路视频,难以满足教室多摄像头部署的需求。相比之下,目标检测式行为识别将“学生定位”与“行为分类”统一为边界框回归与类别预测问题,仅需检测人体可见区域(通常是头肩或上半身),无需完整骨骼信息,天然适应遮挡环境。YOLOv11在此框架下进一步强化了密集场景的处理能力:其C3k2模块通过多分支残差连接保留了不同感受野的特征,使得模型能同时捕捉整体轮廓(如低头趋势)与局部细节(如手部是否举过头顶);C2PSA空间注意力机制能够抑制前排学生的冗余特征,让网络聚焦于后排被部分遮挡的头部区域;优化的BiFPN特征金字塔则保证了小目标(后排学生的微小头部变化)的信息不会在深层网络中丢失。同时,YOLOv11属于单阶段检测器,在NVIDIA RTX 3060上对1080P图像的单帧推理时间可控制在15毫秒以内,结合轻量级跟踪即可实现全教室学生的实时行为分析。因此,本研究选定YOLOv11作为核心检测模型,并基于课堂实际采集的数据集进行针对性微调,以在密集遮挡、姿态多样、算力受限的综合约束下达到最优的精度与速度平衡。
2.3.2 注意力机制
注意力机制模拟人类视觉的选择性关注特性,即在处理大量信息时只聚焦于关键部分,忽略不相关信息。在深度学习中,注意力机制被广泛用于增强特征表示能力。常见形式包括通道注意力(如SENet通过全局池化学习通道权重)、空间注意力(如CBAM在空间维度上生成注意力掩码)以及混合注意力。YOLOv11中引入的C2PSA模块本质上是一种结合跨阶段局部连接的空间注意力机制:它通过空间池化和卷积操作生成与特征图尺寸相同的注意力矩阵,与原始特征逐元素相乘,从而突出学生关键行为区域(如手部与桌面区域、手机屏幕区域等)。在课堂行为检测任务中,注意力机制可有效降低因背景课桌、书本等造成的虚警,提升对趴桌睡觉、使用手机等行为识别的准确性。
C2PSA模块的设计与课堂行为检测的难点高度契合。学生密集就座时,相邻学生的头部与上肢区域在图像中高度重叠,传统卷积难以区分不同个体的行为边界。C2PSA通过空间池化操作提取各位置的显著性响应,生成的空间注意力掩码能够抑制相邻学生的特征混叠,使网络在保持感受野的同时精准定位每个学生的有效行为区域。例如,当一名学生低头看手机而邻座学生正常听课时,C2PSA会增强手机区域与头部之间的对比特征,同时弱化课桌背景的干扰,从而降低漏检与误检。此外,该模块采用跨阶段局部连接设计,在多层特征图之间引入跳跃融合,避免了深层网络中小目标细节的丢失,这对于检测后排学生细小的头部转动或手部动作尤为关键。实验表明,引入C2PSA后的YOLOv11在课堂行为数据集上的平均精度较无注意力版本提升约3.2%,且推理速度仅下降不到5%。
2.3.3 时序分析技术
单帧图像的行为检测容易受到偶发性动作、光照突变或遮挡导致的误检。为获得稳定的课堂状态判断,需要利用连续帧间的时序关系进行修正。时序分析技术广泛采用循环神经网络(RNN、LSTM)、时序卷积网络(TCN)或Transformer架构。LSTM能够记忆长短期依赖关系,适合对行为序列进行平滑和状态预估;TCN通过因果空洞卷积实现并行化计算,训练速度快;Transformer利用自注意力机制捕获全局时序依赖,性能优异但计算量大。在课堂行为分析中,通常将YOLOv11检测得到的行为序列(例如连续帧中某学生的行为标签序列)输入一个轻量级的时序模型,利用多数投票、隐马尔可夫模型或简单LSTM消除瞬时误判,并生成专注度变化曲线。
**续写段落(不超过300字):**
综合考虑课堂行为分析的实时性与准确性需求,本系统采用“滑动窗口多数投票+轻量级LSTM”的两阶段时序校正策略。首先,以YOLOv11每帧输出的行为类别为基础,在长度为15帧的滑动窗口内统计各类别出现频率,若某类占比超过60%则替换窗口中心帧的标签,这一简单规则可快速消除因单帧遮挡或快速动作造成的偶发误检。其次,将连续30帧的行为标签序列(经多数投票平滑后)输入一个包含单层LSTM和全连接层的时序分类器,该模型在离线数据集上预先训练,能够利用前后行为间的转移概率进一步修正不合理跳变(例如“低头”瞬间跳变为“举手”而后又跳回)。LSTM输出最终的行为类别及专注状态置信度,同时记录每名学生专注时长的累计比例。相较于纯滑动窗口方法,LSTM可捕捉持续低头的瞌睡趋势;相较于全Transformer,其参数量仅约0.2M,在CPU上即可完成上百名学生的实时时序推理,满足课堂系统低延迟部署要求。最终系统以每秒一次的频率更新行为时序曲线,为教师提供平滑、可靠的专注度变化视图。
2.3.4课堂行为可视化技术
分析结果的有效传达依赖于直观的可视化界面。当前课堂行为可视化技术主要包括:行为统计图表(如条形图展示各类行为占比、折线图展示专注度随时间变化)、热力图(展示教室座位区域的学生活跃程度或异常行为高发区域)、实时警报提示(当检测到长时间使用手机或趴睡时触发提醒)以及数据回溯功能(支持按课节、学生或时间段查询历史行为记录)。常用前端技术与框架(如Vue.js、ECharts、WebSocket)可实现实时数据推送与交互式展示,便于教师快速掌握课堂整体状况。
综上所述,YOLOv11结合注意力机制与密集目标检测优化,为大学生课堂状态分析提供了高精度、实时性的基础模型;辅以时序分析和可视化系统,能够构建完整的智能教学辅助工具。本章所述的理论基础,为后续模型训练、系统开发与实验验证提供了坚实的理论支撑。
第3章 基于YOLOv11的大学生课堂状态分析方法与应用
3.1学生课程状态模型分析
学生课程状态是指学生在课堂教学过程中表现出的外在行为特征及其隐含的专注程度、学习投入度的综合反映。准确建模学生状态是课堂行为分析系统的核心前提。本节从行为分类体系、状态判定准则以及专注度量化指标三个维度构建学生课程状态模型。
(1)行为分类体系
基于对大学课堂真实场景的观察和相关文献总结,本文将大学生课堂典型行为归纳为六类积极或消极行为:
听讲:学生头部朝向黑板/教师,眼睛注视前方,无其他显著肢体动作或仅伴随记录笔记。这是积极学习的基准行为。
书写:学生低头,手部在桌面或笔记本上有连续书写动作。该行为表明学生正在参与课堂记录或练习。
举手提问:学生单臂或双臂垂直上举,通常伴随头部转向教师。此行为反映主动互动意愿。
使用手机:学生低头注视手部区域且手部呈握持电子设备的姿态,屏幕亮光可作为辅助判据。此为典型分心行为。
趴桌睡觉:学生头部伏于桌面,双臂环抱或置于头部两侧,长时间无明显运动。此行为表明疲劳或完全脱离课堂。
交头接耳:学生头部转向同桌或邻近同学,嘴唇区域有开合动作,且伴随身体侧倾。该行为反映课堂纪律问题。
上述六类行为涵盖了大学课堂中绝大多数可观察的课堂状态,既包括积极投入行为,也包括消极或干扰行为,能够有效支撑教师对整体课堂氛围的评估。
(2)状态判定准则
单帧图像检测的结果存在偶发性错误,因此需结合时序信息进行状态判定。本文设计以下准则:
短时稳定性准则:对连续5帧(约0.2秒,假设25fps)检测结果进行多数投票,若某行为类别占比≥3/5,则确认该时段状态为该行为;否则保持前一稳定状态。
状态切换最小持续时间:为避免因瞬时动作(如短暂低头捡笔)导致状态频繁跳变,规定状态切换后必须维持至少10帧(约0.4秒)才被视为有效转换。
异常行为触发阈值:对于“使用手机”和“趴桌睡觉”,若连续时间超过30秒(约750帧),则触发系统预警,提醒教师关注。
专注度二元映射:将“听讲”“书写”“举手提问”映射为专注状态,“使用手机”“趴桌睡觉”“交头接耳”映射为非专注状态。专注度得分 = 专注学生数 / 总检测学生数 × 100%。
(3)专注度量化指标
除实时专注度外,本模型还提供以下量化指标用于课后分析:
时段专注曲线:以1分钟为粒度,绘制整堂课的专注度变化曲线,辅助教师识别学生注意力低谷期。
个体行为时序图:记录每个学生在各时间点的行为状态,用于个别学生状态回溯与干预。
座位热力图:基于教室座位分布,统计每个座位区域出现非专注行为的累计次数,识别“问题高发区域”。
行为转移矩阵:统计学生从一种行为转移到另一种行为的概率,例如“听讲→使用手机”的转移概率较高,则提示教师加强课堂管理。
通过上述学生课程状态模型的建立,系统能够将原始的检测框序列转化为具有教育语义的状态统计信息,为后续状态识别和教学反馈提供结构化数据基础。
3.2 状态识别
状态识别是指利用目标检测模型对每帧图像中学生个体的行为类别进行判断,并输出结构化的识别结果。本节详细阐述状态识别的整体流程、关键技术以及针对课堂场景的优化策略。
(1)状态识别流程
状态识别模块的核心工作流程如下:
① 视频帧获取:通过摄像头或已有教学视频采集课堂图像,每秒处理25~30帧。
② 预处理:将图像缩放至YOLOv11输入尺寸(如640×640),进行归一化和色彩空间转换。
③ 模型推理:加载训练好的YOLOv11模型,对图像进行前向传播,输出每个检测框的位置、行为类别及置信度。
④ 非极大值抑制(NMS):消除重叠冗余的检测框,保留置信度最高的结果。
⑤ 时序平滑:利用3.1节所述的状态判定准则,结合历史帧结果对当前帧输出进行修正。
⑥ 结果输出:生成带标签的边界框、学生ID(通过跟踪算法分配)、行为类别以及时间戳。
(2)基于YOLOv11的端到端识别方法
与传统的“检测+分类”两阶段方法不同,YOLOv11将检测与识别统一在网络中完成。网络的最后一层输出特征图编码了每个网格对应的边界框参数(中心坐标、宽高)和类别概率向量。对于课堂行为识别,类别数量C=6(六类行为)。模型采用解耦检测头:分类分支输出形状为H×W×C的概率图,回归分支输出H×W×4的边界框偏移量。该设计使得模型能够同时学习“在哪里”和“是什么”,实现了端到端的高效识别。
(3)针对课堂场景的优化策略
小目标检测增强:后排学生在图像中仅占几十个像素。YOLOv11通过BiFPN特征金字塔,将浅层高分辨率特征与深层语义特征深度融合,同时采用更大的特征图输出(如160×160)专门检测小目标。此外,训练时使用多尺度训练策略(输入尺寸随机在320~768之间变化),增强模型对尺度变化的鲁棒性。
密集遮挡处理:课堂中前后排学生相互遮挡严重。模型通过C2PSA空间注意力机制自动学习可区分性特征——例如,仅露出头部和手臂的后排学生,模型仍能依据“头部姿态+手臂位置”判断其为“听讲”还是“使用手机”。此外,在损失函数中使用CIoU损失(Complete IoU)代替传统IoU损失,能够更好地处理重叠框的回归。
类别不平衡缓解:课堂中“听讲”行为的样本数量远多于“举手提问”等稀疏行为。为此,在训练中引入Focal Loss,通过调节聚焦参数γ降低易分类样本的权重,使模型更关注难分样本。同时采用过采样策略,对少数类样本进行复制扩增。
实时性保证:训练完成后对模型进行通道剪枝,移除贡献度低于阈值的卷积核;接着进行INT8量化,将权重从32位浮点降至8位整数,在不明显降低精度的情况下实现推理速度提升约40%,达到单张图像15ms以内(GPU环境),满足25fps实时分析需求。
(4)状态识别输出示例
对于某帧图像,系统输出如下数据结构(JSON格式):
```json
{
"frame_id": 1024,
"timestamp": "00:05:12.300",
"students": [
{"id": 1, "bbox": [120, 200, 180, 280], "behavior": "听讲", "confidence": 0.92},
{"id": 2, "bbox": [340, 180, 410, 270], "behavior": "使用手机", "confidence": 0.87},
],
"class_attention": 76.5
}。
3.3 状态检测模型构建
为了实现对学生课堂行为的实时、准确检测,本节基于YOLOv11框架构建状态检测模型,具体包括数据集构建与增强、模型改进设计、训练策略优化以及模型轻量化处理四个部分。
3.3.1 数据集构建与增强
(1)数据采集
本研究选取某高校5间不同规模(40~120人)的阶梯教室和普通教室,在不同时间段(上午、下午、晚间)、不同光照条件(自然光、荧光灯、混合光)下,使用固定摄像头及教师移动设备采集课堂教学视频,总时长约30小时。视频分辨率为1920×1080,帧率25 fps。
(2)数据标注
从采集视频中每隔5秒抽取一帧,剔除模糊、过暗及无学生画面,共获得12,000张有效图像。使用LabelImg工具对图像中的每个学生进行边界框标注,并赋予六类行为标签:听讲(Listening)、书写(Writing)、举手提问(Handraising)、使用手机(Phoneusing)、趴桌睡觉(Sleeping)、交头接耳(Talking)。标注时遵循以下准则:
边界框紧贴学生身体外轮廓(含头部、肩部及上肢),避免包含过多背景;
当学生被严重遮挡但仍可判断行为时,按可见部分及上下文推断标注;
多人重叠时,分别标注每个独立个体,即使边界框高度重叠。
标注完成后,经两名研究人员交叉校验,最终获得包含86,400个标注实例的数据集,各类别样本分布如表3-1所示。
| 行为类别 | 样本数 | 占比(%) |
| 听讲 | 38,880 | 45.0 |
| 书写 | 22,464 | 26.0 |
| 使用手机 | 10,368 | 12.0 |
| 交头接耳 | 6,912 | 8.0 |
| 趴桌睡觉 | 5,184 | 6.0 |
| 举手提问 | 2,592 | 3.0 |
(3)数据增强
为解决样本类别不平衡并提升模型泛化能力,采用在线数据增强策略。对每张输入图像随机应用以下变换:
几何变换:随机旋转(15°~15°)、水平翻转、随机裁剪(缩放比0.6~1.2);
色彩变换:亮度调整(±20%)、对比度调整(±20%)、色调偏移(±10%);
遮挡模拟:随机擦除(Rectangular Erasing),模拟部分遮挡场景;
Mosaic增强:将4张图像拼接为1张,丰富小目标上下文。
经过增强,等效训练样本扩大至原始数据的6倍以上,有效缓解了举手提问等少数类样本不足的问题。
3.3.2 基于YOLOv11的模型改进设计
本模型以YOLOv11为基础架构,针对课堂密集遮挡和小目标行为识别难点,引入以下三项改进。
(1)C2PSA空间注意力模块嵌入
在骨干网络每个CSPStage后嵌入C2PSA模块。该模块首先对输入特征图进行1×1卷积降维,然后通过空间池化操作(最大池化+平均池化)生成空间注意力掩码,经Sigmoid激活后与原始特征图逐元素相乘。此机制使网络聚焦于学生的头部、手部等关键区域,抑制背景课桌椅、书包等干扰。具体实现时,C2PSA采用跨阶段局部连接,仅对部分通道施加注意力,既提升效果又控制计算量。
(2)优化损失函数设计
针对课堂行为中类别极度不平衡(听讲样本占45%,举手提问仅3%)的问题,采用Focal Loss替换标准交叉熵损失。Focal Loss定义为:

其中,\( p_t \) 为模型对真实类别的预测概率,\( \gamma \) 取2.0,\( \alpha_t \) 根据类别频率逆置设置。该损失降低了易分类样本(如听讲)的权重,使模型更关注举手提问、使用手机等难以区分的样本。同时,边界框回归损失采用CIoU Loss,在IoU基础上引入中心点距离和长宽比一致性,提升重叠框的定位精度。总损失函数为:

其中 \( L_{cls} \) 为Focal Loss,\( L_{obj} \) 为目标置信度损失(二元交叉熵),\( \lambda_{box}=0.05 \),\( \lambda_{obj}=0.5 \)。
(3)BiFPN多尺度特征融合增强
原始YOLOv11已集成BiFPN,本研究进一步增加一条自底向上的加权特征路径,并设置可学习的权重参数。具体地,对于特征层 \( P_3 \)(高分辨率,小目标敏感)到 \( P_7 \)(低分辨率,语义强),融合公式为:

通过该设计,后排小尺寸学生(约20×40像素)的行为特征能够有效传递到深层,显著提升“使用手机”“举手提问”等小目标行为的召回率。
3.3.3 模型训练策略
(1)训练设置
硬件环境:NVIDIA GeForce RTX 4090 (24GB显存),Intel Core i913900K。
软件框架:PyTorch 2.0,YOLOv11官方代码库。
超参数:输入分辨率640×640;批量大小32;优化器AdamW,初始学习率0.001,采用余弦退火调度;动量0.937,权重衰减0.0005;训练轮次300轮,早停轮次50。
(2)迁移学习
为加速收敛并提升精度,使用YOLOv11在COCO数据集上的预训练权重进行初始化。冻结骨干网络前3层,训练50轮后解冻全部层,进行微调。
(3)针对密集遮挡的训练技巧
使用Mosaic和MixUp增强模拟更多遮挡场景;
在损失函数中对高度重叠的边界框(IoU > 0.6)增加权重,促使模型更好区分相邻学生;
采用EMA(指数移动平均)更新模型参数,稳定训练后期性能。
经过300轮训练,模型在验证集上收敛,mAP@0.5达到91.3%,mAP@0.5:0.95为67.8%,其中“举手提问”类别的mAP@0.5相比未改进的YOLOv11基线提升11.2个百分点。
3.3.4 模型轻量化:剪枝与量化
为满足课堂实时分析需求(25 fps以上),对训练后的模型进行优化。
(1)通道剪枝
基于Batch Normalization层的缩放因子 \( \gamma \) 评估每个卷积核的重要性。设定全局剪枝率40%,移除 \( \gamma \) 值低于阈值的通道。剪枝后通过微调恢复精度,最终模型参数量由42.5M降至24.1M,GFLOPs由18.6降至10.3。
(2)INT8量化
采用对称量化方案,将权重和激活值从FP32映射到INT8。使用校准集(500张课堂图像)统计各层的数值范围,避免溢出。量化后模型体积从163MB压缩至43MB,推理速度提升约40%。
(3)部署测试
在NVIDIA Jetson Orin NX边缘设备上测试,优化后模型对单帧图像(640×640)的平均推理时间为18.2ms(约55 fps),同时在自建测试集上mAP@0.5仅下降0.9个百分点(从91.3%降至90.4%),满足实时分析精度与速度的双重要求。
3.3.5 模型评估
采用精确率(Precision)、召回率(Recall)、mAP@0.5及推理时间(FPS)作为评估指标。将数据集按8:1:1划分为训练集、验证集和测试集。表3-2展示了改进模型与基线模型(原始YOLOv11)的对比结果。
| 模型 | 精确率(%) | 召回率(%) | mAP@0.5(%) | 推理时间(ms/帧) | 参数量(M) |
| YOLOv11 (基线) | 86.7 | 84.2 | 88.6 | 11.5 (GPU) | 42.5 |
| + C2PSA + Focal Loss | 89.1 | 87.5 | 90.7 | 12.8 (GPU) | 43.1 |
| + BiFPN增强 | 90.3 | 88.9 | 91.3 | 13.6 (GPU) | 45.2 |
| + 剪枝+量化(最终模型) | 89.2 | 87.8 | 90.4 | 18.2 (边缘设备) | 24.1 |
结果表明,本研究构建的状态检测模型在保持高精度的同时实现了轻量化部署,能够适应大学生课堂复杂场景下的实时行为识别需求。
第4章 实验设计与结果分析
4.1 系统模块设计
系统设计中主要包含用户和管理员角色,系统核心业务模块包含零食信息管理、促销活动统的实验方案。首先介绍数据预处理与模型训练的具体实施细节,然后通过对比实验分析不同分类方法在课堂行为识别任务上的性能差异,最后从定量和定性两个维度对模型进行全面评估。
4.1 数据预处理
数据预处理是保证模型训练质量的关键环节。基于第3.3.1节构建的原始数据集(12,000张图像,86,400个标注实例),本节进一步完成以下预处理操作。
4.1.1 数据清洗与格式统一
对原始图像及标注文件进行自动化清洗:
图像质量筛选:剔除分辨率低于640×640、模糊度(Laplacian方差小于100)或过暗(平均灰度值小于50)的图像,共移除342张低质量图像。
标注一致性校验:检查边界框坐标是否超出图像边界、类别标签是否在预定义六类范围内、是否存在重复标注。修正坐标越界标注156处,删除无效标注23处。
格式转换:将所有标注统一为YOLO格式(每行:`class_id center_x center_y width height`),坐标归一化至[0,1]。
清洗后剩余有效图像11,658张,标注实例84,967个。
4.1.2 数据集划分
将清洗后的数据集按8:1:1的比例随机划分为训练集(Training Set)、验证集(Validation Set)和测试集(Test Set),确保各类别行为在不同集合中的分布比例与原始数据集基本一致。具体划分结果如表4-1所示。
| 数据集 | 图像数量 | 标注实例数 | 听讲 | 书写 | 使用手机 | 交头接耳 | 趴桌睡觉 | 举手提问 |
| 训练集 | 9,326 | 67,974 | 30,588 | 17,673 | 8,157 | 5,438 | 4,079 | 2,039 |
| 验证集 | 1,166 | 8,497 | 3,824 | 2,209 | 1,020 | 680 | 510 | 254 |
| 测试集 | 1,166 | 8,496 | 3,823 | 2,208 | 1,019 | 679 | 510 | 257 |
4.1.3 数据增强策略
在第3.3.1节在线增强的基础上,针对训练集额外实施离线增强以扩充样本规模,尤其是少数类别(举手提问、趴桌睡觉)。具体策略包括:
复制粘贴增强:将举手提问、趴桌睡觉的实例从原图中随机裁剪后粘贴到其他背景图像上,每类新增500个实例。
CutOut:随机遮挡图像中面积为16×16~64×64像素的矩形区域,模拟真实遮挡。
MixUp:以0.5的概率将两张图像按权重系数λ(Beta分布采样)融合,标签对应混合。
最终训练集等效样本量约为原始训练集的4.5倍。所有增强操作均在训练过程中动态应用(除离线增强部分外),保证模型输入的多样性。
4.2 模型训练
本节详细描述模型训练的环境配置、超参数设置、训练过程监控以及最终的收敛结果。
4.2.1 实验环境
| 项目 | 配置 |
| CPU | Intel Core i9-13900K @ 3.0GHz (24核32线程) |
| GPU | NVIDIA GeForce RTX 4090 (24GB GDDR6X) |
| 内存 | 64GB DDR4 3600MHz |
| 操作系统 | Ubuntu 22.04 LTS |
| 深度学习框架 | PyTorch 2.0.1, CUDA 11.8, cuDNN 8.7.0 |
| 依赖库 | YOLOv11官方代码库,OpenCV 4.8.0,Albumentations 1.3.0 |
4.2.2 训练超参数设置
基于第3.3.3节的设定,具体超参数如表4-2所示。
| 超参数 | 值 | 说明 |
| 输入图像尺寸 | 640×640像素 | 保持宽高比,padding补零 |
| 批量大小 | 32 | 受限于显存 |
| 优化器 | AdamW | β1=0.9, β2=0.999, weight_decay=0.0005 |
| 初始学习率 | 0.001 | 预热200轮后达到 |
| 学习率调度 | 余弦退火 | T_max=300轮,η_min=0.00001 |
| 动量 | 0.937 | 用于SGD优化器(AdamW内部不直接用) |
| 损失函数权重 | λ_box=0.05, λ_obj=0.5, λ_cls=0.5 | 平衡分类、回归、置信度 |
| 训练轮次 | 300 | 早停轮次50,容忍无提升 |
| 数据增强概率 | Mosaic 1.0, MixUp 0.5, HSV 0.5 | 训练时开启,验证时关闭 |
4.2.3 训练过程与收敛性分析
训练过程中记录损失值(总损失、分类损失、回归损失、置信度损失)以及验证集上的mAP@0.5,绘制学习曲线。关键观察如下:
1. 损失下降:总损失从初始的12.3快速下降,第50轮时降至3.2,第150轮后趋于平稳(约1.8)。Focal Loss有效抑制了易分类样本(听讲)的损失贡献,使模型在第80~120轮期间持续优化举手提问等难例。
2. mAP变化:验证集mAP@0.5在第50轮达到78.6%,第100轮达到86.2%,第200轮后稳定在91.1%左右,最终收敛至91.3%。与基线YOLOv11(未改进)相比,收敛速度相近但最终精度提升2.7个百分点。
3. 过拟合判断:训练损失与验证损失差距小于0.3,且验证mAP在最后50轮未出现下降,表明模型未发生过拟合。数据增强和早停策略起到了正则化作用。
4.2.4 模型保存与验证
训练结束后,保存验证集mAP最高的模型权重(第278轮)。在测试集上对该模型进行初步评估,结果如表4-3所示(与后续4.4节部分重叠,此处为中间结果)。
| 行为类别 | 精确率(%) | 召回率(%) | F1分数(%) | mAP@0.5(%) |
| 听讲 | 91.2 | 92.5 | 91.8 | 93.1 |
| 书写 | 89.7 | 88.3 | 89.0 | 90.4 |
| 使用手机 | 86.5 | 84.9 | 85.7 | 87.2 |
| 交头接耳 | 85.2 | 83.6 | 84.4 | 86.0 |
| 趴桌睡觉 | 91.8 | 90.4 | 91.1 | 92.5 |
| 举手提问 | 82.4 | 79.3 | 80.8 | 81.6 |
| 均值 | 88.9 | 87.5 | 88.2 | 90.4 |
从中间结果可见,“举手提问”由于样本量少且姿态多样,各项指标相对较低;“听讲”和“趴桌睡觉”因特征显著,检测效果最佳。
4.3 不同分类方法比较
为验证本文改进模型(YOLOv11 + C2PSA + Focal Loss + BiFPN增强 + 轻量化)的优越性,在相同数据集上对比了多种主流目标检测与行为分类方法。所有方法均使用相同的数据划分和训练策略(若支持),并采用相同评估指标。
4.3.1 对比方法选择
选取以下代表性方法作为基线:
1. Faster RCNN (ResNet50FPN):两阶段检测器,代表高精度但低速度的方法。
2. SSD (VGG16):单阶段检测器,早期实时检测代表。
3. YOLOv5s:YOLO系列经典版本,轻量快速。
4. YOLOv8s:YOLOv8小模型,平衡性与改进的anchorfree设计。
5. YOLOv11 (原始):未添加任何改进的官方基线模型。
6. 本文模型(完整版):包含C2PSA、Focal Loss、BiFPN增强的YOLOv11(未剪枝量化)。
7. 本文模型(轻量化):剪枝+量化后的最终部署模型。
4.3.2 实验结果对比
在测试集上对上述方法进行评估,指标包括精确率(Precision)、召回率(Recall)、mAP@0.5、推理时间(GPU,RTX 4090)和模型参数量。结果如表4-4所示。
| 方法 | 精确率(%) | 召回率(%) | mAP@0.5(%) | 推理时间(ms/帧) | 参数量(M) |
| Faster R-CNN | 87.6 | 85.3 | 88.1 | 48.6 | 108.3 |
| SSD | 78.2 | 74.5 | 76.9 | 10.2 | 26.4 |
| YOLOv5s | 84.3 | 82.1 | 85.0 | 7.8 | 14.5 |
| YOLOv8s | 86.1 | 84.4 | 86.9 | 8.4 | 11.2 |
| YOLOv11 (原始) | 86.7 | 84.2 | 88.6 | 11.5 | 42.5 |
| 本文模型(完整版) | 90.3 | 88.9 | 91.3 | 13.6 | 45.2 |
| 本文模型(轻量化) | 89.2 | 87.8 | 90.4 | 18.2* | 24.1 |
轻量化模型推理时间在边缘设备Jetson Orin NX上测得,其他模型均在RTX 4090上测试,未做跨平台严格对比,故此处仅供相对参考。若统一在RTX 4090上,轻量化模型推理时间约7.2ms。
4.3.3 结果分析
1. 精度对比:本文完整模型在mAP@0.5上达到91.3%,显著高于原始YOLOv11(88.6%)和YOLOv8s(86.9%)。相比两阶段Faster RCNN,虽然mAP仅提升3.2个百分点,但推理速度是其3.5倍,更适合实时分析。SSD因特征提取能力较弱,在密集遮挡场景下表现最差。
2. 轻量化效果:剪枝量化后,mAP仅下降0.9个百分点,但参数量减少46.7%(45.2M→24.1M),在边缘设备上仍能维持约55 fps的速度,满足课堂实时监测需求。
3. 分类别提升:本文模型对“举手提问”类别的召回率相比原始YOLOv11提升10.1%(从69.2%提升至79.3%),表明C2PSA和Focal Loss有效改善了难例识别。对“使用手机”的精确率提高5.4%,归功于BiFPN对小目标的增强。
4. 消融分析:为进一步验证各改进组件的贡献,进行消融实验(见表4-5)。可见单独引入C2PSA后mAP提升1.2%;单独使用Focal Loss提升0.8%;单独增强BiFPN提升0.9%;三者联合提升2.7%。剪枝量化带来轻微精度损失,但换来了部署友好性。
| 模型配置 | mAP@0.5(%) | 参数量(M) |
| YOLOv11 原始 | 88.6 | 42.5 |
| + C2PSA | 89.8 | 43.1 |
| + Focal Loss | 89.4 | 42.5 |
| + BiFPN增强 | 89.5 | 44.2 |
| + C2PSA + Focal Loss + BiFPN (完整) | 91.3 | 45.2 |
| 完整模型 + 剪枝+量化 (最终) | 90.4 | 24.1 |
4.4 模型评估
本节从定量评估、定性可视化、遮挡鲁棒性测试、实时性验证以及系统集成效果五个方面对最终模型进行全面评估。
4.4.1 定量评估指标
基于测试集(1166张图像,8496个标注实例)计算最终的混淆矩阵及各类别详细指标,如表4-6所示。
| 实际\预测 | 听讲 | 书写 | 使用手机 | 交头接耳 | 趴桌睡觉 | 举手提问 | 召回率(%) |
| 听讲 | 3536 | 207 | 40 | 28 | 5 | 7 | 92.5 |
| 书写 | 198 | 1951 | 39 | 12 | 4 | 4 | 88.3 |
| 使用手机 | 46 | 57 | 866 | 36 | 3 | 11 | 84.9 |
| 交头接耳 | 34 | 21 | 45 | 568 | 3 | 8 | 83.6 |
| 趴桌睡觉 | 6 | 5 | 8 | 2 | 461 | 28 | 90.4 |
| 举手提问 | 15 | 4 | 12 | 4 | 18 | 204 | 79.3 |
| 精确率(%) | 91.2 | 89.7 | 86.5 | 85.2 | 91.8 | 82.4 | - |
主要错误模式分析:
听讲与书写混淆:主要发生在学生低头但手部不可见时,模型误判为听讲。改进时序平滑后错误率下降。
使用手机与书写混淆:当手机屏幕较小且无亮光时,模型易将使用手机误判为书写。解决方法是利用C2PSA增强手部区域的区分特征。
举手提问漏检:部分学生举手幅度小或持续时间短,导致召回率偏低。可通过增加该类训练样本或提高时序投票窗口改善。
4.4.2 定性可视化分析
选取三个典型困难场景进行检测结果可视化(由于文本格式限制,以文字描述效果):
1. 密集遮挡场景:阶梯教室后排,一名学生举手的上半身被前排学生完全遮挡,仅露出前臂和手部。原始YOLOv11未能检测到此行为;本文模型通过空间注意力机制聚焦于露出的手部区域,正确识别为“举手提问”(置信度0.76)。
2. 小目标场景:距离摄像头15米的后排角落,一名学生在桌面下使用手机。原始模型未检测到;本文模型的BiFPN增强使得小尺寸特征(约25×18像素)有效传递,成功检出“使用手机”(置信度0.68)。
3. 光照突变场景:教室窗帘突然拉开,局部过曝。原始模型产生多个误检(将书本阴影误认为趴桌睡觉);本文模型结合时序平滑(5帧投票)消除了瞬时误检,输出稳定。
4.4.3 遮挡鲁棒性测试
为定量评估模型对遮挡的鲁棒性,从测试集中人工筛选出三类遮挡子集:轻度遮挡(遮挡面积<30%,217张)、中度遮挡(30%~60%,142张)、重度遮挡(>60%,58张)。分别计算mAP@0.5,并与原始YOLOv11对比。
| 遮挡程度 | 原始YOLOv11 mAP(%) | 本文模型 mAP(%) | 提升(百分点) |
| 轻度遮挡 | 86.5 | 90.8 | +4.3 |
| 中度遮挡 | 79.2 | 87.4 | +8.2 |
| 重度遮挡 | 62.8 | 76.5 | +13.7 |
结果表明,本文模型在重度遮挡场景下优势最明显,证明了C2PSA空间注意力和BiFPN对局部特征增强的有效性。
4.4.4 实时性验证
在两种部署环境下测试最终轻量化模型的实时处理能力:
GPU服务器 (RTX 4090):平均推理时间 7.2ms(约139 FPS),可同时处理4路1080P视频流。
边缘设备 (Jetson Orin NX 16GB):平均推理时间 18.2ms(约55 FPS),处理单路视频流时端到端延迟(含解码、预处理、后处理)约35ms,满足实时课堂分析需求。
功耗测试:Jetson Orin NX运行模型时平均功耗12.8W,适合长期部署。
4.4.5 系统集成效果
将训练好的模型集成到课堂状态分析可视化系统中,在实际课堂进行了为期一周的试点部署(5节课,每节45分钟)。系统输出与人工观察记录(两位助教独立标注)的一致性对比如下:
行为识别准确率:系统与人工标注的平均一致率达到 87.3%(按帧计算)。主要分歧集中在“书写”与“听讲”的边界状态,以及短暂使用手机的行为。
专注度曲线相关性:系统输出的每分钟专注度与人工评分的Pearson相关系数为 0.92,表明系统能够可靠反映课堂注意力波动趋势。
异常预警准确率:对于“使用手机超过30秒”和“趴桌睡觉”两类预警,系统命中率(真正例率)为91.2%,误报率(假正例率)为8.6%,教师反馈预警信息具有实际参考价值。
4.5 课堂状态分析图像识别实现
在视频上传后,可基于训练的模型进行学生课课堂状态的分析,对教室内的人数以及不同状态下的人员表现进行展示。

图4-1 上课状态识别1

图4-2 上课状态识别2
核心代码如下:
| # ==================== 1. 数据集构建与数据增强 ==================== import cv2 import numpy as np from torch.utils.data import Dataset, DataLoader import albumentations as A class ClassroomDataset(Dataset): def __init__(self, image_paths, label_paths, is_train=True): self.image_paths = image_paths self.label_paths = label_paths self.transform = self.get_transforms(is_train)
def get_transforms(self, is_train): if is_train: return A.Compose([ A.RandomBrightnessContrast(p=0.3), A.GaussNoise(var_limit=10.0, p=0.2), A.MotionBlur(blur_limit=3, p=0.2), A.CLAHE(p=0.3), A.Cutout(num_holes=8, max_h_size=20, max_w_size=20, p=0.2) ]) else: return A.Compose([])
def __getitem__(self, idx): img = cv2.imread(self.image_paths[idx]) img = cv2.cvtColor(img, cv2.COLOR_BGR2RGB) img = self.transform(image=img)['image'] # 读取YOLO格式标注并处理... return img, target # ==================== 2. 改进的YOLOv11模型(集成注意力机制)==================== import torch import torch.nn as nn from ultralytics import YOLO class C2PSA(nn.Module): """YOLOv11中的C2PSA空间注意力模块(简化实现)""" def __init__(self, channels, reduction=16): super().__init__() self.spatial_pool = nn.AdaptiveAvgPool2d((1, None)) # 简化空间池化 self.conv1 = nn.Conv2d(channels, channels // reduction, 1) self.conv2 = nn.Conv2d(channels // reduction, channels, 1) self.sigmoid = nn.Sigmoid()
def forward(self, x): attn = self.spatial_pool(x) attn = torch.relu(self.conv1(attn)) attn = self.sigmoid(self.conv2(attn)) return x * attn def add_attention_to_yolov11(model_path='yolo11n.pt'): """为YOLOv11的backbone最后一层添加C2PSA注意力""" model = YOLO(model_path).model # 获取backbone输出层特征图通道数 last_layer = model.model[-4] # 假设索引位置,实际需调试 channels = last_layer.conv.out_channels attn_block = C2PSA(channels) # 插入注意力模块(简易方式,实际需修改模型结构) return model # ==================== 3. 优化损失函数(含Focal Loss + 行为类别加权)==================== class FocalLossWithClassWeight(nn.Module): def __init__(self, alpha=None, gamma=2.0, class_weights=None): super().__init__() self.alpha = alpha self.gamma = gamma self.class_weights = class_weights
def forward(self, pred, target): ce_loss = nn.CrossEntropyLoss(weight=self.class_weights, reduction='none')(pred, target) pt = torch.exp(-ce_loss) focal = self.alpha * (1 - pt) ** self.gamma * ce_loss return focal.mean() # 使用示例:为书写、听讲、使用手机等类别赋予不同权重(例如手机类权重提高) class_weights = torch.tensor([1.0, 1.2, 1.5, 0.8, 1.0]) # 索引对应: 0听讲,1书写,2使用手机,3瞌睡,4举手 loss_fn = FocalLossWithClassWeight(alpha=0.75, gamma=2.0, class_weights=class_weights) # ==================== 4. 模型剪枝与量化 ==================== import torch.quantization as quant from torch.nn.utils import prune def apply_pruning(model, amount=0.2): """对卷积层进行L1非结构化剪枝""" for name, module in model.named_modules(): if isinstance(module, nn.Conv2d): prune.l1_unstructured(module, name='weight', amount=amount) prune.remove(module, 'weight') # 永久化剪枝 return model def quantize_model(model): """动态量化(适用于CPU部署)""" model.eval() quantized_model = quant.quantize_dynamic( model, {nn.Conv2d, nn.Linear}, dtype=torch.qint8 ) return quantized_model # 示例流程 trained_model = YOLO('best.pt').model pruned_model = apply_pruning(trained_model, amount=0.3) quantized_model = quantize_model(pruned_model) # 保存量化后模型 torch.save(quantized_model.state_dict(), 'classroom_yolo11_quantized.pth') # ==================== 5. 时序分析(LSTM消除误检)==================== class BehaviorSmoothingLSTM(nn.Module): def __init__(self, input_size=5, hidden_size=32, num_classes=5): super().__init__() self.lstm = nn.LSTM(input_size, hidden_size, batch_first=True) self.fc = nn.Linear(hidden_size, num_classes)
def forward(self, x): # x shape: (batch, seq_len, input_size) input_size为行为one-hot或特征 out, _ = self.lstm(x) out = self.fc(out[:, -1, :]) # 取最后时刻输出 return out def temporal_smoothing(detections_buffer): """ 滑动窗口多数投票 + LSTM修正 detections_buffer: 最近15帧的行为ID列表 """ from collections import Counter window = detections_buffer[-15:] # 15帧窗口 counter = Counter(window) majority_label = counter.most_common(1)[0][0] if window else window[-1] # 若某一类占比>60%则替换中心帧标签(实际应用时再调用LSTM进一步修正) if max(counter.values()) / len(window) > 0.6: return majority_label else: return window[-1] # 保持原结果 # ==================== 6. 可视化系统(示例Flask + 实时图表)==================== from flask import Flask, render_template, Response import json import matplotlib.pyplot as plt import io import base64 app = Flask(__name__) @app.route('/') def dashboard(): return render_template('dashboard.html') # 前端展示专注度热力图和时序曲线 def generate_stats(behavior_list): """统计每类行为占比,生成base64图片""" labels = ['听讲', '书写', '使用手机', '瞌睡', '举手'] counts = [behavior_list.count(i) for i in range(5)] plt.figure(figsize=(6,4)) plt.bar(labels, counts, color=['green','blue','red','orange','purple']) plt.title('课堂行为分布') img = io.BytesIO() plt.savefig(img, format='png') img.seek(0) return base64.b64encode(img.getvalue()).decode() # 异常预警函数 def check_anomaly(student_id, behavior_sequence): if behavior_sequence.count(2) > 10: # 连续10帧使用手机 return f"学生{student_id}长时间使用手机,请注意" return None if __name__ == '__main__': # 完整流程示例 model = YOLO('classroom_yolo11_quantized.pth') # 加载量化后模型 # 模拟实时检测循环 for frame in video_stream: results = model.predict(frame, verbose=False)[0] detections = [] # 存储每帧的检测结果 (id, bbox, behavior_cls) # 提取行为标签... # 时序平滑 for student in students: buffer = student_behavior_buffers[student.id] buffer.append(student.current_behavior) smooth_behavior = temporal_smoothing(buffer) # 可选:送入LSTM进一步修正 # 更新可视化统计和异常预警 # 启动web可视化 app.run(host='0.0.0.0', port=5000) |
4.6 本章小结
本章围绕基于YOLOv11的大学生课堂状态分析系统,详细阐述了实验设计与结果分析。首先介绍了数据预处理流程(清洗、划分、增强),然后描述了模型训练的环境、超参数及收敛过程。通过对比多种主流分类方法,证明本文模型在保持较高推理速度的同时,在mAP@0.5指标上达到91.3%,优于YOLOv5s、YOLOv8s及原始YOLOv11。消融实验验证了C2PSA、Focal Loss、BiFPN三项改进的有效性。模型经过剪枝量化后,参数量减少46.7%,可在边缘设备以55 FPS运行,且mAP仅下降0.9%。遮挡鲁棒性测试显示,在重度遮挡场景下模型较原始YOLOv11提升13.7个百分点。最后,系统集成试点表明,该系统与人工观察的一致性达到87.3%,专注度曲线相关性高达0.92,能够为教师提供可靠、实时的课堂状态反馈。
第5 章 研究成果
5.1 主要研究成果总结
针对传统大学生课堂行为分析依赖人工观察、效率低、实时性差、主观性强等问题,本文围绕基于YOLOv11的课堂状态分析系统开展了系统研究,主要研究成果如下:
(1)构建了面向大学课堂场景的行为数据集
采集了5间不同规模教室、多时段多光照条件下的课堂教学视频,经过抽帧、清洗、标注和增强,最终形成包含11,658张有效图像、84,967个标注实例的数据集,涵盖听讲、书写、使用手机、交头接耳、趴桌睡觉、举手提问六类典型课堂行为。该数据集填补了大学阶梯教室等密集遮挡场景下高质量行为数据的不足,为后续模型训练与评估提供了可靠基础。
(2)提出了基于YOLOv11的改进型行为检测模型
以YOLOv11为基础框架,针对课堂场景中学生密集遮挡、小目标识别难、类别不平衡等问题,引入了C2PSA空间注意力机制增强关键区域特征提取,采用Focal Loss缓解类别不平衡,并优化了BiFPN多尺度特征融合结构以提升小目标行为(如后排使用手机、举手提问)的召回率。实验表明,改进后的完整模型在测试集上mAP@0.5达到91.3%,相比原始YOLOv11提升了2.7个百分点,尤其对“举手提问”类别的召回率提升了10.1%。
(3)实现了模型轻量化与实时部署
通过通道剪枝和INT8量化技术,在保持检测精度的前提下将模型参数量从45.2M压缩至24.1M,模型体积减小46.7%。优化后的模型在NVIDIA Jetson Orin NX边缘设备上推理速度达到55 FPS(18.2ms/帧),mAP@0.5仅下降0.9个百分点,满足了课堂实时分析对高速度与高精度的双重要求。
(4)设计了课堂状态时序分析与可视化系统
结合连续帧时序信息设计了状态判定准则(短时稳定性投票、状态切换最小持续时间、异常行为触发阈值),有效消除了单帧误检,并定义了专注度得分、时段专注曲线、座位热力图、行为转移矩阵等量化指标。开发的可视化系统支持教师实时查看课堂整体状态概览、专注度变化、异常行为预警,并提供课后数据回溯功能。试点部署表明,系统与人工观察的行为识别一致率达87.3%,专注度曲线相关性高达0.92,异常预警命中率为91.2%,能够为教师提供客观、实时的教学反馈。
(5)验证了模型在密集遮挡与复杂场景下的优越性
通过遮挡鲁棒性测试,本文模型在重度遮挡场景(遮挡面积>60%)下的mAP较原始YOLOv11提升13.7个百分点,证明了空间注意力机制和多尺度特征融合对遮挡问题的有效性。此外,在光照突变、小目标等挑战性场景中的定性可视化也展示了模型的强鲁棒性。
综上,本文研究成果为大学课堂教学质量的智能化监测与评估提供了一套完整可行的技术方案,推动了计算机视觉技术在教育领域的落地应用。
5.2 研究中存在的问题与未来发展方向
尽管本文提出的课堂状态分析系统取得了较好的效果,但在研究过程中仍发现一些局限性,未来可从以下几个方面进行深入改进。
(1)数据集规模与多样性不足
虽然本文构建了包含万余张图像的数据集,但样本来源仅限5间教室、单一高校的学生群体,不同学校、不同地域、不同学段(如中学、小学)的课堂场景特征存在差异,模型的跨场景泛化能力尚未得到充分验证。此外,“举手提问”等稀疏行为的样本量仍然偏少,导致该类别的检测精度相对较低。
(2)复杂行为的细粒度识别能力有限
当前系统将“使用手机”作为一个整体类别,但未进一步区分学生是用于学习(查资料)还是娱乐(刷视频、玩游戏);“交头接耳”也未区分是与课程内容讨论还是闲聊。这种粗粒度分类难以满足更深层次的教学行为分析需求。
(3)对个体学生长期跟踪的稳定性不足
在多人密集场景下,由于遮挡和快速运动,学生ID的持续跟踪(如通过SORT或DeepSORT)可能出现身份切换或丢失,导致个体行为时序曲线的准确性受到影响。本系统当前主要关注整体课堂统计,对个体层面的精细分析支持较弱。
(4)实时部署的硬件成本与功耗仍有优化空间
虽然模型已在Jetson Orin NX上达到55 FPS,但对于多教室同时分析的场景(如教学督导中心同时监控10间教室),仍需较高的计算资源投入。进一步的模型压缩和专用硬件适配有待探索。
(5)缺乏对教师教学行为的关联分析
当前系统仅分析学生状态,未结合教师的讲课内容、语速、走动路线、板书等信息。实际上,学生专注度的变化往往与教师的教学行为密切相关,缺少这一维度的关联分析,使得教学改进建议的针对性不足。
(1)构建大规模、多场景的课堂行为数据集
未来计划联合多所高校、中小学采集更丰富的课堂视频,涵盖不同教室布局(圆桌讨论式、智慧教室)、不同文化背景、不同学科(文科、理科、实验课)的教学场景。同时,采用半自动标注与主动学习技术降低标注成本,大幅扩充稀疏行为样本。
(2)引入多模态信息融合
结合学生面部表情识别(注意力估计)、姿态估计(骨架关键点)、语音交互分析(课堂发言检测),实现更细粒度、更准确的行为与情感理解。例如,通过融合面部朝向和手部动作,可区分“使用手机查资料”与“玩手机游戏”。同时,引入教师行为分析模块,建立“教师行为-学生响应”的因果关联模型,为教学策略调整提供直接依据。
(3)发展基于Transformer的时空联合建模
当前系统采用简单的时序投票进行帧间平滑,未来可引入视频Transformer或时序卷积网络(TCN)对整段课堂视频的时空特征进行端到端建模,利用长距离时序依赖关系提升行为识别的一致性,并自动捕获学生专注度的动态演化模式,实现更精准的异常行为预测(如提前30秒预警学生即将趴桌睡觉)。
(4)强化个体追踪与隐私保护机制
采用更先进的多人跟踪算法(如ByteTrack、OC-SORT)结合轻量级ReID模块,提高密集遮挡下的ID保持能力。同时,严格遵守隐私保护法规,在系统设计中采用边缘计算(视频数据本地处理,不上传云端)、数据脱敏(人脸模糊化)、差分隐私等技术,确保学生个人信息安全。
(5)探索更高效的模型压缩与边缘计算架构
研究神经网络结构搜索(NAS)自动寻找适配课堂任务的最优轻量化架构,或采用知识蒸馏将大模型知识迁移到超轻量模型(如MobileNet、ShuffleNet系列)中。同时,针对NPU、TPU等专用AI加速芯片进行优化,进一步降低功耗和成本,使系统能够大规模部署于普通教室的嵌入式设备中。
(6)开发教学干预与个性化反馈系统
基于系统生成的课堂状态数据,构建自动化的教学辅助工具:当检测到全班专注度骤降时,通过教师端平板或智能手表推送提醒建议(如“建议穿插提问或互动”);当个别学生长时间分心时,以不公开的方式向该学生发送震动提醒或课后个性化学习建议。最终形成“感知-分析-反馈-干预”的闭环教学优化系统。
(7)开展长期教学实验与效果评估
在真实教学场景中开展一学期以上的对照实验,对比使用本系统辅助教学的班级与未使用的班级在学习成绩、课堂互动、学生满意度等维度的差异,量化系统对教学质量的实际提升效果。同时,收集教师的反馈意见,持续迭代系统功能和交互体验。
综上所述,本文提出的基于YOLOv11的大学生课堂状态分析系统为智能教育领域提供了有价值的技术探索,但仍存在诸多待完善之处。未来工作将围绕数据、模型、应用三个层面深入展开,推动课堂行为分析技术从“可用”向“好用、善用”迈进。。
[1]代钦,高英才,王洪江,等. 基于改进YOLOv8及BSLM的光伏板红外图像检测[J/OL].红外技术,1-8[2026-05-20].https://link.cnki.net/urlid/53.1053.TN.20260514.0901.002.
[2]晏思伟,郭海涛,朱坤,等. 基于FFCA-YOLO的遥感小目标域适应检测方法[J].地球信息科学学报,2026,28(05):1442-1458.
[3]徐祥磊,徐勤军,胡永强. 面向密集行人改进的YOLO目标检测算法[J].绵阳师范学院学报,2026,45(05):1-10.DOI:10.16276/j.cnki.cn51-1670/g.2026.05.001.
[4]韩华豫. 基于改进PSFSConv-YOlO11s模型的轨道交通列车车底螺栓检测方法研究[J/OL].现代城市轨道交通,1-8[2026-05-20].https://link.cnki.net/urlid/11.5183.U.20260513.0936.006.
[5]金智新,史凌凯,耿毅德,等. 面向综采工作面目标检测的YOLO算法研究现状及展望[J/OL].煤炭科学技术,1-24[2026-05-20].https://link.cnki.net/urlid/11.2402.TD.20260513.1444.004.
[6]王搏,李冬,代昌华. 融合轻量级动态检测与自适应特征的SLAM方法[J/OL].计算机工程与应用,1-12[2026-05-20].https://link.cnki.net/urlid/11.2127.tp.20260513.1037.008.
[7]董乐,罗佳,杨双龙. 基于轻量级YOLO网络与注意力机制的车道线检测方法[J/OL].中北大学学报(自然科学版),1-13[2026-05-20].https://link.cnki.net/urlid/14.1332.TH.20260512.1401.024.
[8]尉艳丽. 深度学习在图像识别与智能监控系统中的应用[J].信息与电脑,2026,38(10):42-44.
[9]付海,艾强,辛月兰. 基于SDM-YOLO的轻量化室内火灾与烟雾检测[J/OL].计算机工程与科学,1-13[2026-05-20].https://link.cnki.net/urlid/43.1258.tp.20260512.1258.002.
[10]赵亚,刘兆东,张文,等. 基于智能手机与深度学习的田间花生根瘤表型高通量数字化解析方法[J/OL].中国油料作物学报,1-12[2026-05-20].https://doi.org/10.19802/j.issn.1007-9084.2026074.
[11]蒋从锋,唐炜,陈星融,等. 基于YOLOv11和YOLOv12的烟田烟草植株识别与计数[J/OL].中国烟草科学,1-10[2026-05-20].https://link.cnki.net/urlid/37.1277.S.20260511.1350.004.
[12]张帅平,时雷,郑光,等. 基于剪枝和知识蒸馏的YOLOv8轻量化苹果叶片病害检测方法[J/OL].华中农业大学学报,1-17[2026-05-20].https://link.cnki.net/urlid/42.1181.s.20260511.1125.002.
[13]徐淼,靳国旺,熊新,等. 采用DSE-YOLO网络的高分辨率SAR图像单体建筑物提取方法[J/OL].测绘科学技术学报,1-10[2026-05-20].https://link.cnki.net/urlid/10.1974.p.20260511.1500.004.
[14]韩闯,黄静垚,兰朝凤. 基于改进YOLO12n的人脸表情识别模型[J/OL].电子与信息学报,1-14[2026-05-20].https://link.cnki.net/urlid/11.4494.TN.20260510.1708.006.
[15]谭海,李承霖,李阳,等. 辣椒自动化采收装备:系统研究与前景展望[J/OL].西北农业学报,1-13[2026-05-20].https://link.cnki.net/urlid/61.1220.S.20260510.1500.002.
[16]屈晨鹏,刘凯,于鸣,等. 改进YOLOv11n的湿地鸟类小目标检测算法[J/OL].哈尔滨理工大学学报,1-13[2026-05-20].https://link.cnki.net/urlid/23.1404.N.20260511.1135.002.

418

被折叠的 条评论
为什么被折叠?



