论文
分布式人工智能推理系统中的时间、因果关系和可观测性故障
Time, Causality, and Observability Failures in Distributed AI Inference Systems
摘要
分布式人工智能推理管道严重依赖基于时间戳的可观察性来理解系统行为。这项工作表明,即使节点之间的时钟偏差很小,也会导致可观测性变得因果不正确,而系统本身仍然保持功能正确和高性能。我们提出了多节点人工智能推理管道的受控实验,其中在单个阶段引入了时钟偏差。结果表明,在同步条件下且偏差高达 3 ms 时,未观察到任何违规行为,而 5 ms 时就会出现明显的因果关系违规行为。尽管如此,系统吞吐量和输出正确性在很大程度上仍然不受影响。我们进一步观察到违规行为并不是严格静态的。在较长的运行中,负跨度率可能会随着时间的推移而稳定或减少,这表明有效偏差是由于节点之间的相对时钟漂移而发生的。使用 Kafka 和 ZeroMQ 传输进行实验,两者结果一致。 Aeron 正在积极探索中,但尚未包含在已完成的验证集中。这些发现表明,可观测性的正确性不仅取决于系统功能,还取决于精确的时间对齐,并且必须将时序视为分布式人工智能系统中的首要问题。