学术视点

学术视点

日期:2026-08-19

|  来源:【字号:

题目:A Multi-Objective Optimization Framework for Data Cleaning Using Large Language Models(基于大模型的数据清洗多目标优化框架)

作者:T. Hu et al

来源:Big Data Mining and Analytics(大数据挖掘与分析), vol. 9, no. 3, pp. 672-686.

摘要:The use of Large Language ModelsLLMsin data cleaning tasks has demonstrated impressive capabilities. However, the high inference costs associated with LLMs pose significant challenges, particularly when managing large-scale datasets within constrained budgets. While many studies focus on direct methods to reduce inference costs, we propose a novel framework to alleviate the high inference costs of LLMs by transforming the task into a multi-objective optimization problem. This framework begins by decomposing the complex data cleaning task into smaller, well-defined sub-tasks. For each sub-task, the most appropriate method is selected from a range of options, such as rule-based tools, code generation methods, smaller pretrained language models, or LLMs, depending on the tradeoff between cost and effectiveness. This allows for a systematic balance between cost and quality, enabling the completion of high-quality data cleaning tasks within budget constraints. Experimental results validate the effectiveness of this approach. The framework significantly reduces inference costs while maintaining high-quality data processing. This framework offers a practical pathway to optimizing LLM-based data cleaning methods, balancing computational efficiency and data processing quality. Future work could explore the dynamic adaptations for evolving sub-tasks or deeper integrations with explainable AI and human-in-the-loop approaches to enhance trust and interpretability in data cleaning pipelines.

编者译:大模型在数据清洗任务中展现出了令人瞩目的能力。然而,大模型高昂的推理成本带来了巨大挑战,尤其是在预算受限的情况下处理大规模数据集时。尽管许多研究侧重于直接降低推理成本的方法,本文提出一种全新框架,通过将数据清洗任务转化为多目标优化问题,有效缓解大模型高昂的推理成本。该框架首先将复杂的数据清洗任务拆解为多个定义明确的小型子任务。针对每个子任务,根据成本与效果的权衡,从基于规则的工具、代码生成、小型预训练模型或大模型等多种方案中选择最合适的方法。这种方式使系统在成本与质量之间取得平衡,从而在预算限制内完成高质量的数据清洗。实验结果验证了该方法的有效性。该框架在保持高质量数据处理的同时显著降低了推理成本,为优化基于大模型的数据清洗方法提供了一条实用途径,实现了计算效率与数据质量的平衡。未来工作可探索如何针对不断演变的子任务实现动态适应,或与可解释人工智能及“人在回路”方法深度结合,以增强数据清洗流程的可信度与可解释性。

题目:超大规模集成电路全局布局布线算法研究综述

作者:李旭、李晨、姜金荣、陆忠华、迟学斌

来源:数据与计算发展前沿, 2026, 8(3): 122-136.

摘要:本文从研究对象和算法思想两个维度,对超大规模集成电路全局布局与全局布线的研究进行了系统分类与总结。同时,本文分析了近年来机器学习在布局与布线中的应用趋势。目前全局布局的解析算法和全局布线的顺序布线算法与机器学习方法的结合正成为布局布线的重要发展趋势,未来需进一步提升算法的并行化能力。

题目:IIN-Health: A Dual-Chain Federated Learning Framework with Adaptive BFT Consensus for Auditable Medical Data SharingIIN-Health:一种用于可审计医疗数据共享的自适应BFT共识双链联邦学习框架)

作者:S. Zhu, C. Sun, H. Zhang and L. Wang

来源:Intelligent and Converged Networks(智能与融合网络), vol. 7, no. 2, pp. 146-165.

摘要:Federated Learning (FL) is increasingly deployed in healthcare to enable collaborative intelligence while keeping sensitive data privately at local institutions. However, existing healthcare-oriented FL frameworks still suffer from several limitations: they are vulnerable to adversarial model updates, provide limited transparency and verifiable auditability, and often lack predictable performance under constrained resources. We present IIN-Health, a blockchain-enhanced intelligent fusion network tailored for dependable healthcare FL. IIN-Health adopts a dual-chain architecture with policy-aware access control and auditable provenance tracking to integrate learning, security, and governance in a unified framework. Evidence-Carrying Access Tokens (ECATs), combined with zero-knowledge proofs, are introduced to enforce patient-defined policies and validate access decisions without disclosing sensitive information. In addition, we design MedBFT-Δt a domain-specific Byzantine fault-tolerant protocol that ensures reliable system behavior in the presence of faulty or malicious participants. We conduct several experiments to validate its feasibility and accuracy on the MNIST dataset. The results demonstrate that IIN-Health achieves smooth and stable convergence, exhibits strong resilience against poisoning attacks, and maintains graceful performance degradation under resource constraints, while preserving verifiable auditability of model updates and data flows. These observations indicate that IIN-Health can provide a practical balance among performance, security, and regulatory compliance, and thus offers a promising foundation for trustworthy and scalable FL deployments in healthcare.

编者译:联邦学习在医疗领域的应用日益增多,旨在实现协同智能的同时确保敏感数据安全留存于本地机构。然而,现有的面向医疗领域的联邦学习框架仍存在若干局限性:容易受到对抗性模型更新的攻击,透明度和可验证审计能力有限,且在资源受限的情况下往往缺乏可预测的性能。本文提出IIN-Health,一种专为可靠的医疗联邦学习量身定制的、由区块链增强的智能融合网络。IIN-Health采用具备策略感知访问控制和可审计溯源追踪的双链架构,将学习、安全与治理整合于统一框架中。框架引入携带证据的访问令牌并结合零知识证明,在不泄露敏感信息的前提下执行患者定义策略并验证访问决策。此外,本文设计了MedBFT-Δt特定领域拜占庭容错协议,确保系统在存在故障或恶意参与者时仍保持可靠运行。本文在MNIST数据集上进行多项实验以验证框架的可行性与准确性。结果表明,IIN-Health实现了平滑稳定的收敛,对投毒攻击展现出强大抵抗力,在资源受限时性能平稳降级,同时维持对模型更新与数据流的可验证审计能力。实验结果表明,IIN-Health能够在性能、安全性与法规合规性之间取得有效平衡,从而为医疗领域建立值得信赖且可扩展的联邦学习部署奠定良好基础。

题目:高能物理科学数据汇交服务平台建设

作者:王爽、张红梅、陈刚、齐法制

来源:数据与计算发展前沿, 2026, 8(3): 51-58.

摘要:高能物理大科学装置产生的科学数据呈现海量性和复杂性特点,是重要的国家战略资源。对其进行规范化汇交与管理,能够促进科学数据资源的充分利用并支撑科技创新,具有重要的应用意义。然而,传统高能物理科学数据服务平台多侧重于数据开放,缺乏以科技项目为源头对科学数据进行全生命周期汇交的能力支撑,难以满足国家战略需求。针对上述挑战,本文设计并搭建了高能物理科学数据汇交服务平台,实现从元数据提交到数据发布的标准化、流程化管理。平台遵循用户友好与功能可扩展的设计原则,构建了涵盖“用户注册—汇交意向—汇交计划—数据提交—数据审核—数据发布”的全流程规范化管理体系。截至目前,该平台累计支撑87项科技项目数据汇交,其中国家重点研发计划项目79项,中科院先导专项计划项目8项,涉及多个大科学装置。累计汇交科学数据集1190个,数据总量达5.78PB,所有数据集均已通过国家高能物理科学数据中心网站向社会公开发布。该平台的建设与应用能够推进高能物理科学数据的规范化管理和共享,进而充分挖掘科学数据的科学价值,为科学研究和重大发现提供坚实的数据支撑。

题目:数据价值跃迁视角下全国一体化数据市场建设的逻辑理路与实践进路

作者:刘巍、牟冰清、柳颖

来源:大数据,2026,12(03):81-97.

摘要:全国一体化数据市场建设被赋予承载和贯通数据价值实现全过程的重要使命。基于数据“资源化—产品化—资产化—资本化”价值跃迁框架,引入数据价值网络理论,从价值创造主体与价值活动机制两个维度,对制约数据价值实现的关键因素进行系统解析。研究发现,当前数据价值跃迁主要受到数据产业链尚不完备、数据多模流通形态不成熟以及数据与其他要素联动机制不畅等多重约束。针对上述问题,提出以全流程产业链构建、多样化流通机制优化以及跨要素市场联动为核心的实践进路,以期为加快培育全国一体化数据市场、推动数据要素价值持续跃迁提供理论支撑与实践参考。

题目:大语言模型的自我恒定性现象及其在知识增强任务上的应用

作者:雷艳、庞亮、魏子豪、王元卓、沈华伟、程学旗

来源:大数据,2026,12(03):98-114.

摘要:近期研究指出,检索和大语言模型中存在显著的“源偏见”,即相较于真实人类数据,其更偏好模型生成的内容。人类存在类似的“自我恒定性”现象,即倾向于维护自我概念的一致性,相较于外部事实,其更倾向于相信已有的知识。探讨大模型是否表现出与类人的认知偏差,分别从显式方式(模型自身生成的内容)与隐式方式(提示词诱导模型认为内容是其生成的)两方面展开研究,并结合自评估与一致性两种置信度评价方法,在GPT-4oDeepSeek-R1Llama27B70B)、Qwen27B72B)等模型上进行了系统实验。结果表明,在隐式方式下,模型表现出明显的自我恒定性,对自身内容有显著更高的信心。利用该特性可以系统提升模型在各类知识增强任务中的表现:在TriviaQANQHotpotQAFEVERZsRE等数据集上,角色提示策略带来准确率提升;在存在大量噪声干扰文档时,仍能保持稳健优势,显示出良好的鲁棒性和泛化性。最后,揭示了指令微调与人类反馈强化学习是导致模型产生此类偏见的核心因素,从训练与对齐机制层面解释了自我恒定性的形成。


附件: