编者寄语

随着人工智能大模型在自然语言处理、科学计算和多模态生成等领域展现出卓越性能,其背后的“黑箱”机制也引发了广泛关注。模型规模的指数级增长让其具备了更强的推理与生成能力,但同时也带来了决策不可追溯、错误不可预警和安全性难以保障等问题。如如何揭示模型“为何这样推理”与“何时可能失效”,成为人工智能迈向可信与可控发展的关键课题。

为此,本选题以可解释性作为理解智能行为的关键切入点,探讨大模型透明化的理论框架、算法设计与应用实践。内容涵盖机制可解释性、解释与对齐、鲁棒检测、决策逻辑评测及可信应用等多个维度,希望为研究者提供构建透明、可信人工智能体系的技术启发和未来研究方向的参考。


编委主任:苏金树 CCF会士 军事科学院教授

本期主编:闵巍庆 CCF多媒体技术专委会秘书长 中国科学院计算技术研究所副研究员

大语言模型的机制可解释性

尽管大语言模型在人工智能多个领域显示出极强的通用性,但理解其内部机理仍缺乏可规模化的手段和理论,这给下一代大模型的设计和优化带来了挑战。自2023年以来,机理可解释性为大语言模型的规模化可解释性带来全新的活力,为分析大模型的行为和机理提供了很好的工具。报告将介绍我们在大语言模型可解释性方面的研究进展,并展望可解释性技术对大模型训练数据、幻觉、安全性等重要问题的结合点。

格式:
视频
大模型解释与对齐

大模型复杂的结构让人们越来越难对它们进行理解、预测和掌控。我们应该怎么找到大模型瓶颈,找到性能提升的方向,又确保大模型在各个复杂的现实场景都安全、与人类意图对齐呢?通用人工智能的新范式给解释和对齐带来了什么挑战和机遇呢?本报告围绕这些问题进行探讨,介绍大模型解释和对齐方面的最新进展,聚焦高普适性概念解释及其如何解读神经元功能,探讨宏观基础价值对齐及其与社会学、测量学的可能结合点。

格式:
视频
基于可解释人工智能与大语言模型的虚假信息鲁棒检测技术进展

多模态虚假信息是指通过文本、图像等多种渠道传播的虚假内容。此类信息在社交媒体平台上尤为猖獗,因其制作成本低且能快速触达海量受众。现有检测方法普遍存在鲁棒性不足、可解释性欠缺等问题,而这些特性恰恰是人工智能系统成功应用于虚假信息检测实践的关键要素。本报告介绍若干基于深度学习的新型解决方案。所提出的方法植根于两大基础研究:通过神经符号算法设计的可解释人工智能,以及大语言模型(LLM)技术。此外,深入探讨多模态虚假信息检测在泛化能力与可迁移性方面的未来研究方向。

格式:
视频
大模型内部精细决策逻辑正确性解释、评测与对齐

虽然近年来神经网络的可解释性研究得到了广泛的关注,但是大部分可解释性研究依然停留在工程技术层面,尚缺少相对严谨的理论体系从根本机理层面统一解释神经网络的知识表达和其表征性能。本报告介绍张拳石团队所提出的基于等效交互的可解释性理论体系,以及如何在等效交互理论体系下严谨地量化神经网络所建模的“交互概念”表征,如何理论证明解释的严谨性,如何实现对大模型精细决策逻辑的评测,如何对大模型安全性进行量化评估。

格式:
文章
可信大模型技术及应用

大模型通过学习大量数据获得强大的生成能力,但由于数据的复杂性,模型会产生看似真实却实质上错误的信息,也就是“幻觉”问题。本报告介绍图算一体的大模型的可信增强技术,使大模型在应用中具有更强的可靠性与可解释性。同时报告还将进一步分析大模型在碎片化信息整合、事件脉络分析等一系列应用中的技术模式,并进一步探讨以大模型为智能底座的应用框架与标准体系。

格式:
视频

本期编委成员