每一个半导体测试程序背后都对应一个数字,但这个数字很少得到应有的关注——故障覆盖率。故障覆盖率是指在芯片所有可能的缺陷中,测试程序能够检测到的比例,而这一比例与测试经济性中的其他因素密切相关。
了解故障覆盖率、围绕其的成本压力以及决定其上限的设计阶段决策,正是区分测试策略与测试习惯的关键所在。
故障覆盖率究竟衡量什么
故障覆盖率并非在某种直观意义上衡量一颗芯片被测试得有多彻底。它衡量的是测试能够识别出多少种可能的失效模式。95%的故障覆盖率并不意味着芯片已经完成了95%的测试,而是表示:由于某些失效模式不可见,仍有5%的潜在失效模式不会在生产车间被捕获,而可能被最终用户发现。
这一区别至关重要,因为覆盖率在边际上并非免费。最后几个百分点针对的是最难触及的失效模式,而实现这些模式的成本也最高。它们需要更多测试时间、更复杂的测试内容,并且取决于芯片最初设计时的测试方式。故障覆盖率的经济性与测试车间的经济性,正是在这里交汇。
一毫秒的成本
大批量半导体生产的规模较大,单颗芯片上的微小变量会累积成巨大的总成本。如果每颗芯片的测试程序比原计划多花一秒,而整个生产批次达到数千万颗,那么额外增加的测试时间可能高达数百小时。由于执行测试的设备背后存在特定的成本结构,测试时间是生产车间中重点管控的变量之一。
自动测试设备(ATE)系统是一种资本资产,其单价通常高达数百万美元。它的成本按其整个使用寿命内提供的测试小时数摊销,而这种摊销后的小时费率直接计入每颗出货良品的成本。产品总成本中测试所占的比例,可通过将每颗芯片的测试时间乘以满载小时费率,再除以良率来确定。
管理这一问题的主要杠杆是多工位测试,即在同一台ATE上并行测试多颗芯片。工位数越高,单台测试机每秒可处理的被测器件数量就越多,而不是一次只处理一个。工位数翻倍并不会使每颗芯片的有效测试时间恰好减半,因为有些开销并不随并行度成比例缩减,但效果仍然接近。除多工位之外,测试程序还会持续调优——针对速度优化仪器设置,并移除对覆盖率没有贡献的内容。
成本与覆盖率
为进一步说明测试时间经济性的量级,不妨以测试机满载费率为每秒0.10美元、一颗芯片需要两秒测试时间为例。一次测试一颗,每颗芯片的测试成本是0.20美元;而并行测试两颗,每颗芯片的有效测试时间大约减半,成本降至0.10美元左右。这一差异看似微不足道,但若考虑到测试量,其影响却十分显著。在两千万颗的规模上,每颗芯片节省0.10美元就是两百万美元,而这几乎完全取决于测试机一次能处理多少颗芯片。
当测试内容被去除时,这种权衡关系才真正显现出来。如果需要压缩测试时间,而测试内容又是影响测试时长的一个因素,那么接下来的问题便是:当成本压力遇上维持覆盖率的要求时,会发生什么。
紧张关系及其原因:解决它需要超越工程层面的努力
测试时间与故障覆盖率朝相反方向拉扯。成本压力(如上一节所述)显而易见:减少测试时间,以降低每颗合格芯片的成本。在不减少测试内容的前提下缩短测试时间,意味着以更快的速度达到同样的覆盖率,这虽然可行,但有极限。通过移除测试内容来压缩测试时间,则意味着覆盖率会下降——如上文提到的非线性关系所示——而即便覆盖率只是小幅下降,也可能导致逃逸数量明显增加。
这不是工程本身能够解决的问题,因为答案取决于工程流程之外的商业背景,需要考虑以下因素:
- 能接受多少逃逸?
- 在怎样的现场退货成本下?
- 针对哪些客户?
一家消费电子产品制造商和一家汽车供应商,即便考虑同样的覆盖率,所面对的风险特征却截然不同。
在消费电子领域,可接受的缺陷水平通常以百万缺陷数(DPPM)来衡量。而在汽车和工业细分市场中,相关单位是十亿缺陷数(DPPB),门槛收紧了一千倍。这一差异并不只是客户偏好问题,而是反映了安全关键型系统中现场失效所带来的监管与责任风险,这与消费电子设备中失效的风险有着根本不同。
因此,设定故障覆盖率是一项商业决策,其财务影响在两侧都具有可量化的后果。它处于成本与质量的交汇点,因而更应被当作一项整体考量而非单方面问题来处理。
DFT是设定上限的杠杆
芯片一旦在物理上存在,故障覆盖率和测试时间都在生产车间进行管理,但在流程更早的阶段,还有一个强有力的杠杆在发挥作用。
故障覆盖率受两个管理杠杆影响:生产期间的测试效率,以及设计期间的可测性。
可测性设计(DFT)是指在制造开始前的设计阶段,就将测试访问能力集成到芯片中。一个具体的例子是嵌入芯片内部的内置自检(BIST)逻辑,它使芯片能够测试自身的部分功能,而不必完全依赖外部ATE。一颗具有精心设计的BIST的芯片,能够以更少的时间实现更高的故障覆盖率,因为部分测试基础设施已内置在器件内部,而非从外部施加。
DFT的范围比BIST更广,因为它涵盖了设计阶段的决策,而这些决策决定了测试程序能在多大程度上访问芯片的内部状态。一个常见的例子是扫描链,它将芯片内部元件连接成结构化的路径,使测试机能够通过这条路径向芯片加载特定状态,并以同样的方式读取结果。这使得芯片中原本会被隐藏的部分变得可见。如果芯片在设计时就考虑了可测性,测试工程师就有了可用的工具。而一颗未如此设计的芯片,则为可实现的覆盖率设定了上限,且这一上限事后无法提高。
由于DFT是有成本的,它会影响经济特性。它占用硅片面积——具体占比取决于设计和所选方法——并且会在设计定稿之前增加工程时间。设计与测试团队会共同权衡这些取舍,一方面考虑面积和进度,另一方面则关注覆盖率和产品质量。这是一项基于共同目标的联合决策:让产品在满足质量要求的同时,其成本能够支撑业务。
为什么DFT决策在流片前就至关重要
在流片之前投资于DFT,可在流程中以最低成本获得最佳覆盖率。在生产流程中通过单独的测试步骤(如延长测试时间或增加测试插入)来弥补测试车间的DFT不足,会推高每一颗芯片的生产成本。在现场承受覆盖率不足的后果,是所有选项中最昂贵的一种,因为生产过程中遗漏的缺陷最终可能以召回或赔偿责任的形式回归。
DFT与其他测试投资的不同之处在于其不可逆性。测试步骤时长、测试限值以及多工位配置都可以在之后调整,但DFT决策在设计阶段就已被锁定。芯片一旦流片,且最终设计被送往晶圆厂,该芯片的可测性就固定了。如果一款产品的DFT无法支撑满足其质量要求所需的故障覆盖率,则在测试车间无法进行任何修复,也无法弥补差距。
与测试程序和生产设置不同,DFT决策一旦设计流片,就基本不可逆。
决定此后一切走向的决策
测试工程中的其他每一个杠杆,都是在芯片已经制造完成之后才发挥作用的。测试时间可以压缩;测试限值可以收紧或放宽;多工位配置可以提升吞吐量。所有这些杠杆都是可调的,但它们全都受制于芯片设计所允许的范围。
DFT是测试流程中唯一一个无法后期更改的决策。它必须在生产数据尚未建立、无法验证的情况下提前做出,并在硅片面积和设计进度等多重需求之间做出权衡。这一决策离对产品终端市场质量要求的清晰认识越远,就越难以校准得当。将这种市场视角更早地带入设计阶段,而非等到测试阶段再做决定,正是将DFT从一项技术选择转变为战略选择的关键所在。
在一个单次重大逃逸事件就可能带来数亿美元召回与赔偿成本的行业中,在芯片制造之前决定要为其构建怎样的可测性,并非一个工程细节,而是一项战略性承诺,它决定了后续每个阶段所能采取的选项。