Doubrawa2023GalaxyClusterOptical

Brief #

  • 针对 mock data 进行了基于 membership 的 richness 测量,具体细节在 sec3 中
    • 简单来说是做简单的红移筛选,然后运行 2D HDBSCAN
    • 因为方法比较简单所以可以实现 mock/observation 的良好对比(虽然其实距离 observation 还存在距离?)
  • 从 richness 作为 proxy 的性能和 p_mem 的合理性两个方面检验了 AME 的表现

Intro #

  • halo mass proxy 应该具有的优良性质:intrinsic scatter 很低、不依赖于 cluster 动力学状态(其实 orientation 也能尽量摆脱 selection bias)、观测容易获得
    • 各种方法的 intrinsic scatter 大致可以降低到 0.2-0.3 的程度
  • this work 聚焦于窄带巡天(尤其是 S-PLUS),这种巡天可以提供相比宽带巡天更高精度(但是低于 spec-z)的 photo-z
    • 视线方向的主导因素是 photo-z error
  • this work 另外一个 focus 是 cluster 成员星系的概率化判定,最早可能来源于 Brunner & Lubin 2000
    • “we take a step back” 尽可能少地依赖于模型假设/先验知识

Mock catalog #

  • 模拟来自 A21 和 W22,基于 Millennium+H15 SAM 构建,目的是模拟 S-PLUS DR1 的观测结果
  • 选取了全部 M200 高于 12.8、具有超过 3 个成员星系(用 merger history 判定)的 halo 作为样本,红移限定在 0.45 以内
  • 为每个星系生成了模拟 photo-z 观测以及 SED
    • photo-z 的模拟观测生成一个 Gaussian 形式的 PDF
      • error 随星等变化,中位值是 0.026
    • 根据 SAM 包含的 SFH 以及 stellar mass 可以计算出星系在任意时刻的 SED 以及多波段测光数据

Density-based probablistic membership #

  • FAE (fixed aperture estimator) 使用具有 500kpc 的半径和 3sigma(photo-z nmad)高度的 cylinder 来统计星系数目
    • 每一个星系的成员概率定义为 photo-z PDF 在 cylinder 高度范围内的积分(相当于如果 photo-z 在 cylinder 中平面上积分结果是 99.73%)
    • richness 定义为所有成员的 probability 之和,并且进行背景扣除
      • 计算为:给定红移处的平均面密度和 500kpc aperture 的乘积
    • 和真实 halo mass 具有一定相关性,但是斜率很小导致区分效果不好(fig1)
      • 原因在于不同 cluster 的成员延伸到不同范围
      • 其实区分度还取决于误差(应该定义为斜率和误差的商)
  • 更好的方法是 AME (adaptive membership estimator)
    • 首先仅考虑 2.5Mpc 范围内、和 cluster redshift 相差不超过 3sigma 的星系
    • 计算 number density profile,然后用 Kneedle 算法找到最佳的 knee/break point 作为 cluster/field 的分界线(fig2)
    • 对于所有星系根据 photo-z PDF 进行抽样,然后进行基于红移/velocity dispersion 的 3sigma clipping
    • 根据星系的二维坐标运行 HDBSCAN
      • 最小的 cluster size 由 FAE 计算出的 richness 计算得到(fig3 中显示 FAE richness 基本是真实 richness 的两倍)
    • 将以上过程迭代若干(this work 取 100)次(区别在于 Monte Carlo 随机抽样?),membership probability 定义为 100 次中被分类 cluster member 的次数比例

Results #

  • Rc 平均来说大致等于 0.6 R200,和 R500 具有类似的大小
    • 其实有点类似 splash-back radius
  • 在星系位置/红移完全打乱的 galaxy catalog 上运行 FAE/AME 两种方法(fig5)
    • FAE 的测量结果具有接近 0 的中位数,但是具有较大的 MAD(1.05)可能会构成 false positive
    • AME 方法给出的结果对于大部分随机点都是 0,有 24% 随机点产生了高于 1 的 richness
      • 部分地来自 HDBSCAN 的 min_samples 的机制 
  • AME richness 和真实 richness 之间大致有 1-1 的对应关系(fig6)
    • 均值大约 -0.01,标准差 0.119
  • 计算了 richness、加权 luminosity 以及加权 stellar mass 三种 proxy 研究其表现(fig7)
    • mock catalog 中包含了 stellar mass
    • 用 linmix(优势是可以考虑两边的误差)拟合三种 proxy 和 M200 之间的 scaling relation
    • 最佳的 proxy 是加权 stellar mass(scatter 大约 0.1),剩余两种方法的 scatter 分别是 0.181 和 0.151
      • 也就是加权 luminosity 也是优于 richness 的
  • 算法对于 mis-centering 和红移的偏差不太敏感
    • 偏移 50kpc 对结果影响不大,当偏差增加到 250kpc 时结果会有显著的低估
    • 红移偏差超过 0.02~0.03 时 richness 会低估 20% 左右
  • PDF 相对于 Gaussian 的偏离影响不大
    • 测试了 student 分布以及 bimodal 分布,只有当 bimodal 比例高于 50% 的时候才会影响 richness

Individual memberships #

  • 对于 P_mem 的概率定义检验的方法就是按照 P_mem 分 bin 然后检查每个 bin 内的真实 member 比例(fig8)(类似于离散化的 PIT)
    • 整体的趋势是低概率 member 被低估、高概率 member 被高估(和 Sohn2018HectoMAPClusterSurvey 中对于 redMaPPer probability 的检验类似)
      • 所以这里的 p_mem 不具有严谨的统计意义,只是一个 score
  • 在 completeness - purity plane 上研究算法的表现
    • c/p 依据真实 membership 进行定义
    • 通过给 probability 加一个 cut 可以将连续的、概率性质的概率定义转化为 0/1 划分从而计算 c/p
    • 将 threshold 定为 0.75 的时候达到了一个较好的平衡点,具有 63% purity 以及 85% completeness(fig9)
    • c/p 表现对于高红移和低 richness 的系统反而更好(fig10)
      • 可以解释为高红移的对比度更高、而低质量系统一般集中在更小的范围内
  • 利用 membership 可以进行红移和位置的重新确定,这里和真实红移/位置以及 PZWav 进行了比较
    • 红移基本全部保持不变,scatter 小于 1e-3
    • cluster 中心相比有平均 64kpc 的偏移,这是由于 DM halo 中心和 optical center 的分离
    • 和 PZWav 中心相比有平均 128kpc 的偏移,因为 PZWav 更关注大尺度 galaxy 分布,而 this work 的中心确定依赖的是 HDBSCAN 找到的致密结构

Thoughts #

  • 绘图用的是衬线字体看起来很舒服
  • membership probability 确实不应该考虑 magnitude/radius 两个 filter
  • 简化之后确实可以很好地用 mock 来研究各种 cluster finder 组分的影响/作用,因为 mock/observation 中都使用同样的 cylinder count
  • cluster redshift 直接采用真实值?
    • 假定 cluster 红移和位置是已知的
  • mock catalog 中的 photo-z PDF 假设是 gaussian,但是真实数据的非 Gaussian PDF 也可以得到利用
  • 多次采样的 Monte Carlo 做法有点类似 Yantovski-Barth2024CluMPRGalaxyClusterfinding
  • 按照 radial 方向的 number density profile 来做截断看起来是很粗糙的做法,是可以优化的
  • 可以思考运行 2D HDBSCAN 的可能性
  • 0.1 scatter 显然是有点 ideal 的,观测中很多额外的误差没有传递到 mock data 中
  • p_mem 应该能做到统计上严谨?或者说应该可以找到概率分配过于极端的原因
    • 想到 CAMIRA 的 pmem 分布其实是偏向 0/1 两个极端的,这个问题会更严重
  • 高红移和低 richness 系统表现更好有点奇怪
    • 低红移可以解释为 photo-z 表现的差异