学术视点
| 来源:【字号:大 中 小】
题目:Multi-Layer Stacking Ensemble Learning Framework Utilizing Gut Microbiota Data for Colorectal Cancer Classification(基于肠道微生物组数据用于结直肠癌分类的多层堆叠集成学习框架)
作者:Y. Liu et al
来源:Big Data Mining and Analytics(大数据挖掘与分析), vol. 9, no. 4, pp. 919-938.
摘要:The gut microbiota has been increasingly recognized as a promising non-invasive biomarker source for Colorectal Cancer (CRC) detection. In this study, we develop a multi-layer stacking ensemble learning framework that integrates multiple machine learning models to improve the classification accuracy of CRC based on gut microbiota profiles. Our framework is trained using publicly available microbiome datasets comprising 1129 samples from diverse geographical regions (Europe, America, and Asia), and independently evaluated on an external validation cohort collected from Peking Union Medical College Hospital (PUMCH) in China. Based on our experiments, feature extraction of gut microbiota at the genus and species levels is found to achieve the best performance. The framework integrates multiple base classifiers—including Light Gradient Boosting Machine (LightGBM), eXtreme Gradient Boosting (XGBoost), Random Forests (RF), and Support Vector Machines (SVM)—combined through a weighting layer to optimize final classifications. Analysis of the feature importance in the trained model reveals several microbial populations previously reported to be associated with CRC, such as Gemella morbillorum and Fusobacterium nucleatum. These findings support the microbiological interpretability of our proposed framework. Experimental results show that our ensemble model achieves an Area Under the Receiver Operating Characteristic Curve (namely ROC_AUC) of 77.04% when validated on a real-world clinical dataset from Peking Union Medical College Hospital, surpassing existing microbiome-based CRC classification approaches.
编者译:肠道菌群日益被视为一种有前景的非侵入性结直肠癌(CRC)生物标志物来源。本文开发了一种多层堆叠集成学习框架,该框架整合了多个机器学习模型,旨在基于肠道菌群特征提高结直肠癌的分类准确率。该框架基于公开的微生物组数据集进行训练,该数据集包含来自欧洲、美洲和亚洲等不同地理区域的1129个样本,并在中国北京协和医院(PUMCH)收集的外部验证队列上进行了独立评估。结果显示,提取属和种这两个分类级别的肠道菌群特征,能获得最佳的模型表现。该框架整合了多个基础分类器——包括轻量级梯度提升机、极限梯度提升机、随机森林(RF)和支持向量机(SVM)——并通过加权层进行组合以优化最终分类结果。此外,通过分析模型中各特征的重要性,本文发现模型识别出的关键微生物(如麻疹孪生球菌和具核梭杆菌),正是此前已被报道与结直肠癌相关的菌种。这表明该框架的预测结果具有明确的生物学可解释性。在基于北京协和医院真实临床数据集的验证中,本文提出的集成模型取得了77.04%的接收者操作特征曲线下面积(即ROC_AUC),性能超越了现有的基于微生物组的结直肠癌分类方法。
题目:LXformer: A Long-Term Time Series Forecasting Model Based on Multi-Granularity Feature Extraction for Edge Devices(LXformer:面向边缘设备的多粒度特征提取长期时间序列预测模型)
作者:Z. Chen, R. Lin, B. Xu, Y. Shao, X. Tu and L. Zhao
来源:Big Data Mining and Analytics(大数据挖掘与分析), vol. 9, no. 4, pp. 939-958.
摘要:Multivariate time series forecasting is a fundamental research problem in the Internet of Things (IoT), as it provides critical decision support and underpins the accuracy and reliability of downstream intelligent systems. Existing approaches commonly rely on sequence decomposition strategies that separate time series into trend, seasonal, and residual components. However, limited attention has been paid to how temporal information can be represented and integrated across different granularities. Inspired by the human reading process, in which information is progressively understood at the word, sentence, and paragraph levels, we propose LXformer, a novel forecasting framework that captures multiscale temporal representations. After segmenting multivariate time series into patches, LXformer integrates information at multiple granularities by modeling intra-patch features, inter-patch dependencies, and inter-sequence relationships to accomplish the forecasting task. Specifically, multiple one-dimensional convolutional branches are employed to extract fine-grained local patterns within each patch from diverse perspectives. In addition, agent attention is introduced to facilitate effective interactions across patches and channels, enabling the modeling of coarser-grained temporal dependencies. The combination of one-dimensional convolutions and linear-complexity attention mechanisms ensures that LXformer maintains overall linear computational complexity. Extensive experiments conducted on nine large-scale real-world datasets demonstrate that LXformer consistently achieves lower forecasting errors while delivering faster inference speed and reduced memory consumption. These advantages make LXformer particularly suitable for deployment on edge devices with limited computational resources but high accuracy requirements.
编者译:多元时间序列预测是物联网(IoT)领域的基础性研究问题。多元时间序列预测能够为决策提供关键支撑,并为下游智能系统的准确性与可靠性奠定基础。现有方法通常依赖序列分解策略,将时间序列分离为趋势、季节和残差分量。然而,不同粒度下时间信息的表征与整合方式尚未得到充分关注。受人类阅读过程的启发——即信息在单词、句子和段落层面上被逐步理解,本研究提出了一种捕获多尺度时间表征的新型预测框架——LXformer。在将多元时间序列分割为数据块后,LXformer通过建模块内特征、块间依赖关系以及序列间关系来整合多粒度信息,从而完成预测任务。具体而言,LXformer采用多个一维卷积分支,从不同视角提取每个数据块内的细粒度局部模式。此外,LXformer引入代理注意力机制以促进跨数据块和跨通道的有效交互,从而实现对更粗粒度时间依赖关系的建模。一维卷积与线性复杂度注意力机制的结合,确保LXformer保持了整体线性计算复杂度。在九个大规模真实世界数据集上进行的广泛实验表明,LXformer能够持续实现更低的预测误差,同时提供更快的推理速度和更低的内存消耗。LXformer的上述优势使得LXformer特别适合部署在计算资源有限但对精度要求较高的边缘设备上。
题目:多源异构数据高质量数据集构建与关联敏感性分析识别技术研究
作者:王迪、安冰、冯函宇、范梓豪、李明翰、茹一伟
来源:数据与计算发展前沿, 2026, 8(3): 96-109.
摘要:在数字化时代,多源异构数据呈现爆炸式增长,其蕴含的巨大价值日益凸显。各级电网日均处理超亿条网络访问日志,涵盖数值型、指令类别型、告警文本型等多元数据类型,这些数据广泛分布于调度自动化系统、物联网、新能源并网监测等关键业务场景,蕴含着支撑电网智能决策、设备状态预判、安全风险防控的巨大价值。然而,数据质量缺陷与关联敏感性风险成为制约这些数据价值释放的突出瓶颈。为此,本文针对上述两大瓶颈,提出了一套面向数据“质量-安全”的综合技术方案。在高质量数据集构建层面,提出基于扩散模型的MTabGen方法,通过多模态联合优化实现数据缺陷的高精度插补;在数据关联敏感性分析层面,提出采用图卷积神经网络DGDCN构建数据关联图谱,识别敏感关联路径。实验验证表明,MTabGen方法在准确率和完整性指标上显著优于传统数据构建方法;图卷积神经网络DGDCN在精确率、召回率和F1值上全面超越传统机器学习方法。
题目:基于拓扑结构与相似度信息融合的教育知识图谱节点重要性评估模型
作者:李美子、伍云芳、卢淑怡、王浩、杨茹
来源:大数据,2026,12(04):117-136.
摘要:大模型与知识图谱深度融合背景下,教育知识图谱向自动化、语义增强方向发展的趋势,指出节点重要性评估是支撑个性化学习与智能教学的核心任务。现有方法分为两类:基于统计指标的传统方法(如度中心性、PageRank及其改进算法)侧重于拓扑结构,但忽视语义信息;基于图神经网络的可训练方法(如GENI、RGTN等)虽提升了结构建模能力,却难以融合节点语义相似性与动态演化特征。针对教育知识图谱层次化结构、丰富语义关联和动态演化性等特点,现有通用方法存在明显局限:传统方法未能有效整合语义信息,图神经网络方法则忽视不同层次或学科节点的重要性差异。为此,本文提出TSFM模型,通过融合拓扑结构与节点语义相似度优化嵌入表示,并采用重要节点驱动的评估标准动态调整评分,以实现对跨学段、多学科知识图谱中节点重要性的精确评估。实验结果表明,该模型在多个评价指标上优于现有方法。
题目:大模型检查点技术综述
作者:张超、李杨灏、李凯、王子鉴、王彦棡、曹荣强
来源:数据与计算发展前沿, 2026, 8(3): 203-216.
摘要:本文系统综述了大规模语言模型(LLM)训练中检查点技术的应用现状与发展趋势,总结当前模型检查点技术的研究进展,并展望未来的研究方向。通过深入研究大模型检查点的全流程,重点探讨异步检查点、压缩策略、容错机制和异构资源及框架下的兼容性等关键技术的研究进展。当前研究已形成基于分层存储架构与增量式检查点的多模态优化路径,在检查点存储效率、恢复速度和系统稳定性方面取得显著突破。然而,现有技术在存储效率、容错机制、I/O开销以及实际分布式大规模训练的适应性方面仍存在局限,难以完全满足大模型快速发展的需求。本文首次系统梳理了LLM训练检查点技术全流程关键环节与核心进展。未来需聚焦灵活可靠的检查点解决方案、高效存储优化、智能容错及异构兼容,以适配大规模分布式训练需求。
