AI使用笔记

笔记排查问题

排查问题:先测量,别让 AI 连着试五种修法

一位同事用 AI 工具时经常卡住、断开重连。这类问题最省事的做法,是让 AI 连着试几种修法,看哪个管用。可一次改好几个地方,就再也分不清是哪个起了作用,也回不到原来的状态。所以我们先测量,再动手。

几条从弯路里学到的

观测点要放在用户走的那条路上。我在另一个城市放了一台观测机,连续采集了四十多万个样本,据此判断「线路全面变差」。后来从服务器一侧反向测量,才发现那台观测机走的是云服务商自己的线路,和普通宽带用户走的根本不是同一条,而普通宽带方向并没有同样变慢。数据再多,采集的位置错了,结论就是错的。

测网络质量,别只信 ping。ping 用的协议会被一些网络设备单独处理,测出来的数字可能完全失真。直接对目标端口建立 TCP 连接并计时,要可靠得多。如果握手耗时集中在 1 秒出头,通常是握手时丢了一个包,等了约 1 秒才重发(Linux 默认的首次重传等待是 1 秒)。

报错数要先除以用量。用得多的那天,报错自然也多。比较「哪天最差」之前,先换算成「每一百次请求出几次错」,再看看那天是不是周末、数据导出得全不全。

设计对照之前先问:两组在要验证的那一点上,真的不同吗?我们有两次对照做完才发现,两个测试点在关键因素上其实一样,结果说明不了任何问题。

这个问题到现在还没有最终结论。上面这几条,是目前为止最有用的收获。