Esteves2025CopacabanaProbabilisticMembership

Brief #

  • 用 Bayesian 框架计算了 membership probability 以及概率加权的总 stellar mass 作为新的 halo mass proxy
    • 在 Buzzard mock data 上进行测试,所以存在 truth value 供验证和对比
  • 最终性能表现取决于 photo-z error 以及 aperture size 的选择
    • MOR scatter 在低红移大致可以降至 0.05dex
    • 针对 membership 判断的 p/c 曲线表现很好

Intro #

  • 之前的方法存在的问题是 selection/projeciton effect 以及 red sequence 无法被模拟很好地复现
  • previous work 尝试用加权 stellar mass 取代 richness 作为 mass proxy
  • copacabana 是独立于 finder 过程的概率计算过程,也就是 cluster 的位置、红移等都是已知的
    • cluster catalog 可以来自于 optical/X-ray/SZ 等方法

Formalism #

  • 加权总 stellar mass 依赖于单个星系 stellar mass、成员概率以及 aperture radius 三个量
    • 单个星系 stellar mass 依赖于红移
  • 成员概率的计算来自由 member/field 组成的 Bayesian 全概率公式
    • 先验概率计算为 aperture 和 annulus 两个区域内的 surface number density 之比(超额面密度越高则 member 先验越强)
    • 分解为 radius, redshift, color 三个独立的概率(红移和颜色肯定不是独立的吧?)
      • radius filter 将 member/field 分别建模为 pNFW 和 uniform 分布
      • 红移分布分别假设为 Gaussian(误差近似等于 photo-z error)和 KDE 得到的全部星系的红移分布
      • 颜色分布采用 data-driven 的方式:cluster aperture 以内的颜色分布减去根据比例/面积归一化的 annulus 内的颜色分布
        • 颜色选用单一维度,具体选取根据红移变化
    • 采用类似 percolation 的方法解决公共成员的问题,但是顺序有所不同:对于一个星系计算其属于多个 cluster 的概率,然后从高到低依次扣除 p_free 和 p_mem 的乘积
      • 其实从 Bayesian 的角度出发可以写 cluster A + cluster B + field 的全概率公式
  • 用红移概率 Pz 作为预筛选权重参与下面两步的计算
    • Pz 计算为 PDF 在给定 window 内(这里定义为 ±2sigma)的积分
  • 背景扣除采用 local 形式,this work 采用了 4-6Mpc 内的 annulus 作为背景来源
    • 采用 Pz 作为权重
  • aperture radius 利用 HOD 确定
    • 计算成员星系 number count profile(以 Pz 加权),根据 HOD 转化为给定半径处的 mass,可以得到 mass profile
    • 用 mass profile 可以确定一个 R200c 作为 aperture
  • 单个星系 stellar mass 利用 sps 计算(this work 使用的是 fsps)
    • 首先建立一个 SED library,将待测星系和 library 进行匹配,根据匹配 likelihood 对星系模板的 stellar mass 进行加权平均,其他参数则被 marginalize

Validation setup #

  • 采用用于模拟 DES Y3 的 BUZARD mock data
    • 构建算法是 addgals,对光度函数、2PCF 等特征有足够好的近似(相对 SDSS)
      • 绝对星等亮于 -19.5 的限定下,对于超过 5e13 质量的 halo 具有和 Tinker 2012 HOD 相似的结果(fig1)
  • 在对数质量和红移网格上对 halo 进行均匀采样(fig2),得到 2200 个 DM halo
    • 红移分布在 0.1-0.65 之间,质量均高于 13.5
  • photo-z 的模拟考虑了 0.01/0.03/0.05 三种情况,分别大致对应 LSST/DES/SDSS 的数据质量
  • 验证的指标包括
    • 加权 stellar mass 和真实值之间的差别
    • cluster size(R200c)和真实值之间的差别
    • 根据 membership 结果计算的 purity/completeness
    • 加权总 stellar mass 和 halo mass 之间关系(MOR)的参数

Results #

  • stellar mass 和真实值之间的关系大致沿着 1-1 分布(fig3),而 nMAD 和 photo-z error 和 aperture radius 都存在依赖关系(fig4)
    • 更低的 photo-z error 和更小的 aperture 可以降低 nMAD
    • 单个星系 stellar mass 的误差(假设在 0.2dex 量级)是不可忽略的,其影响大于 photo-z error 造成的误差
  • 算法计算出的 R200c 和真实值之间有系统性的 bias,可以通过大约 0.63 的 factor 校正
    • 校正之后的效果大约可以做到无偏,scatter 在 30% 左右
  • fig6 给出了 membership 判断的 purity/completeness 曲线,在最佳的 photo-z error 情况下可以达到 80-90% 的 p/c
    • 曲线上位置的变化通过调整 probability 阈值实现
    • 采用更小的 aperture radius 同样可以提升表现
  • fig7 展示了 proxy 和 halo mass 之间的关系
    • 虽然改变 aperture 可以实现更精确的 stellar mass 测量,但是和 halo mass 之间的 scatter 也会增大,所以二者之间的 scatter 和 aperture radius 关系不大
    • 斜率和 aperture 有较强的相关:扩大半径引入更多的污染(也就是更大的 richness)导致斜率变浅(fig9)
    • 应该对比的是同时考虑斜率和 scatter 的「在给定 proxy 下推断 mass 的 scatter」(fig10)
      • 最终结论是:photo-z error 较低时可以选用较大的 aperture,而 photo-z error 较高时应该选较小的 aperture
      • 在低红移处大致具有 0.05-0.15 dex 的 scatter

Thoughts #

  • 全套 Bayesian 会面临的问题是:需要一个对 member/field 的先验估计,而 member 数量/比例本身是由 finder 产出决定的,也就是最终还是需要迭代过程,有漂移的风险
  • 这个 percolation 确实比 redMaPPer 要合理一点,因为 rich cluster 抢走 poor cluster 的成员是没有先验合理性的
  • 一般即使用 1+z 进行归一化,photo-z error 也是高红移下更大?
    • 还需要考虑 malmquist bias
  • 在 simulation/mock 工作里面 scatter 都可以逼近 0.05-0.1,但是观测可能要差一点
  • 「以 stellar mass 为基础的 proxy 性能表现的瓶颈在 stellar mass 估计上」不是非常令人意外的结论,也许可以思考加权 luminosity 作为替代的可能性
  • r200c 的计算看起来不那么可靠,而且会有循环论证的风险