NADC AI4S新成果 | 让Euclid星系图像数据处理AI-ready 化
发布时间:
2026-09-11 16:04
修改时间:
2026-09-11 15:29
文章类别:
阅读次数:
35

编者按:
AI 正在重塑天文学的研究范式。面对这一趋势,国家天文科学数据中心主动布局天文数据×AI:让数据更好用、工具更智能、科研产出更高效。随着相关工作持续推进,更多成果即将陆续产出。为此,我们新增“NADC AI4S成果速递”专栏,及时分享新的成果。

 

近日,国家天文科学数据中心(NADC)研究团队完成的论文 Making Euclid VIS Imaging AI-Ready: A Scalable Pipeline for Morphology, Anomaly Detection, and Similarity Search 被《天体物理学杂志增刊》(The Astrophysical Journal Supplement Series,ApJS)接收。论文第一作者为中国科学院大学研究生谢锦晖,通讯作者为国家天文台许允飞副研究员和崔辰州研究员,合作者包括张震,陈朗等。研究围绕 Euclid 可见光图像的批量处理与复用需求,建立了连接切图、图像特征提取、形态分类、异常候选筛选与相似图像检索的统一流程。

 

研究背景与数据基础

研究使用 Euclid 首次快速数据发布(Q1)的可见光成像资料,整理了 365,513 幅以星系为中心的 VIS 切图及对应的 384 维特征。大样本分析通常需要反复进行目标定位、裁切、预处理和星表匹配,统一的处理规则可以减少不同任务间的重复准备。

 

图像准备与特征提取

Euclid 的可见光图像记录了星系的轮廓与亮度分布。用于机器学习前,巡天拼接图像需要按目标位置裁切并统一处理。研究团队依托国家天文科学数据中心开发了批量切图服务(https://nadc.china-vo.org/mwr/euclid-imagecutout/),读取目标列表后完成相应位置的图像裁切与输出。切图服务代码已公开,可供复查处理步骤和部署使用。

切图服务支持批量任务和独立请求的并行处理,并持久保存已生成的图像。再次请求相同目标与配置时,系统直接调用已有结果,减少重复的拼接图像提取工作。这里的可扩展性指处理本次发布规模的数据、组织批量任务,以及在重复访问时复用已生成的图像。
切图经预处理后转换为 224 × 224 的模型输入,由预训练的 DINOv2 ViT-S/14 提取特征。每幅图像对应一个 384 维向量,称为嵌入表示。向量保存模型提取的视觉特征,类别预测和星表量估计由后续的分类、回归模型完成。DINOv2 在特征提取阶段保持参数固定,各项分析共用这些向量。

本文用 AI-ready 描述已完成输入整理、元数据匹配和特征提取的数据状态。使用者可依据图像、星表与特征之间的对应关系,准备分类、回归等任务的输入。

图 1 Euclid VIS 数据处理与分析流程示意。切图经过预处理后,由冻结的 DINOv2 模型提取 384 维特征,供回归、形态分类、异常候选筛选和相似检索使用。图中的彩色特征分布为流程示意,低维投影用于可视化。图片来源:论文图 1。

UMAP 将高维特征投影到二维平面,四个面板分别按星表量着色(图 2),便于观察局部分布。图中的颜色梯度提供了描述性线索,回归实验进一步量化特征中可提取的星表信息。

图 2 DINOv2 特征的二维 UMAP 可视化。四个面板分别按椭率、Kron 孔径长半轴、峰值面亮度及其与总星等之差着色,显示样本为 12 万个对象。投影用于观察局部结构,高维空间的全局距离不能直接从图上读出。图片来源:论文图 2。

 

星系形态信息的定量验证

回归实验在独立保留的测试样本上评估了椭率、Kron 孔径长半轴、峰值面亮度及其与总星等之差等四项星表量的预测效果。四项任务的决定系数 R² 为 0.377 至 0.596,其中椭率的结果最高。结果说明,固定的图像特征中包含可由简单回归模型提取的星表信息,不同目标量的可恢复程度存在差别。

图 3 利用固定 DINOv2 特征预测四项星表量。横轴为星表中的测量值,纵轴为回归预测值,颜色表示测试样本密度,虚线为两者相等的位置。各项指标均在未参与训练的测试样本上计算。图片来源:论文图 3。

形态分类实验比较了线性分类器与浅层多层感知机(MLP)在不同标注预算下的表现。评估标签来自 Galaxy Zoo Euclid Q1 星表中经高置信度筛选的 Zoobot 预测,并遵循其形态问题树的适用条件。实验衡量的是模型与这些预测标签的一致程度,未使用另行建立的独立人工标注测试集。每项任务的测试对象固定,训练与模型选择所用的验证标签均计入总标注预算。

以各任务开发集的 1% 作为训练与验证的总标注预算时,固定特征配合 MLP 在光滑与有结构、侧向与非侧向、圆形与雪茄形三项二分类任务中的宏平均 F1 分别为 0.831、0.802 和 0.861。这些数值为三次不同随机种子实验的平均结果。宏平均 F1 对各类别的 F1 等权平均,综合反映精确率与召回率。

旋臂与非旋臂任务的类别分布高度不平衡。在同一设置下,宏平均 F1 为 0.484,接近简单基线,显示出当前特征在这一样本条件下的局限。各项形态任务仍需依据各自的样本与标签定义评估。

图 4 四项形态分类任务在不同标注预算下的测试结果。曲线比较固定 DINOv2 特征上的线性分类器与 MLP,误差棒为三次随机种子实验的标准差,横向虚线为简单分类基线。光滑、侧向和圆度任务与高度不平衡的旋臂任务呈现不同表现。图片来源:论文图 4。

 

异常候选筛选与相似图像检索

研究用局部离群因子(LOF)评估图像在高维特征空间中的局部稀疏程度,再结合前述 UMAP 二维投影中的位置条件筛选,得到 1,681 个待检查候选。这一排序用于安排大样本图像的人工复核顺序。

论文展示的候选包括空白或截断切图、亮星衍射影响、混叠和低信噪比图像。候选名单及其数量依赖算法参数和筛选条件,主要用于图像质量检查与人工复核。认定特殊天体仍需要结合原始观测和其他证据。

图 5 高排序异常候选的代表性图像。示例展示空白或截断切图、饱和与衍射结构、混叠及低信噪比图像,说明该流程在数据质量检查中的用途。候选的身份和成因仍需结合观测信息核验。图片来源:论文图 7。

相似图像检索从一幅查询图像出发,先在特征空间中寻找邻近对象,再结合形态、星表量和图像质量信息进行重排。论文给出了圆形、细长和具有明显结构等目标的检索结果,供样本浏览和对照检查。示例中的组合权重由人工指定,分数用于检索排序,未作概率校准。

图 6 不同形态查询目标的相似图像检索示例。每行最左侧为查询图像,右侧为排序后的四个邻近对象。图中组合分数用于检索排序,未作概率校准。图片来源:论文图 9。

 

数据共享与流程复用

公开流程保留了图像与星表的对应关系、样本划分和评估记录。研究者可复用已有切图和特征,按自己的科学问题调整任务设置,并检查相应的处理步骤与结果。相关切图、形态星表和预计算特征已通过国家天文科学数据中心的数据页面(https://doi.org/10.12149/101833)提供。论文对应的分析软件v1.1.0已在 Zenodo(https://doi.org/10.5281/zenodo.21629100)归档。使用这些资源时,应分别遵循观测数据与软件的许可、访问和引用要求。

 

资源链接:

)
Yang Hanxi
(文章编辑:
我们使用cookies为您提供更好的体验。继续使用本网站,即表示您同意按照我们的Cookie 政策使用cookie。
接受