No Restrictions
登录 打开聊天

为什么AI聊天在高峰时段会排队

阅读约 2 分钟

为什么AI聊天在高峰时段会排队

模型运行在图形硬件上,而这种硬件没法临时快速增加,需求又会在几个主要时区的下午同时达到高峰。硬件满负荷时,服务方要么拒绝用户,要么把他们排成一队。谁能排到前面,通常由他们用的是哪个套餐决定。

聊天窗口里出现一个候诊室,会让人感到意外,因为整个互联网早已训练所有人期待即时服务。这背后的经济学,其实更接近一家餐厅,而不是一个网站,而排队正是这一点显现出来的地方。

本页内容
  1. 容量没法随着高峰临时拉伸
  2. 队列的顺序,是一个商业决定
  3. 排队和上限,常常一起出现
  4. 消息之间的间隔,不是排队
  5. 合理的疑问

容量没法随着高峰临时拉伸

一个模型回答问题时,会占用一块图形硬件,占用时长和生成回答的时间相当。这种硬件是提前几个月采购的,而且价格昂贵到没有人会为了应付高峰而多买,然后让它一天里剩下的时间闲置。当欧洲和北美同时清醒活跃时,需求就会上升,而需求和硬件之间的缺口,就变成了排队。

队列的顺序,是一个商业决定

容量解释了为什么会有排队。但它解释不了为什么你排在别人后面。服务方出售优先权,所以付费客户会被排到前面,其他人则填满剩下的空间。所以一个候诊室同时是两样东西:一场真实的短缺,也是一套销售说辞。

排队和上限,常常一起出现

产生排队的同一个下午,往往也是每日上限被消耗得最快的时段,因为大家的工作时间是重合的。同时撞上这两者,感觉上像是这项服务彻底崩溃了。其实那只是两种各自独立的机制,恰好在同一个时钟上达到了各自的高峰。

消息之间的间隔,不是排队

你自己消息之间几秒钟的间隔,是速率限制,不管服务当下忙不忙都会适用。排队则是在轮到你之前把你扣住,取决于其他人。把这两者搞混,会让人把一个固定不变的设置,错怪成服务器负载的问题。

合理的疑问

排队会不会意味着我的消息丢了?

不会。排队中的消息会被保留,等硬件腾出空间之后就会被回答。丢失是一种故障,而不是排队本身。

规模较小的服务排队会更少吗?

有时候是这样,因为同时涌入的人更少。相对于人均的容量,比公司规模本身更重要。

为什么各地的高峰时段总是差不多?

使用量跟随最大几个市场的工作时间,所以高峰会对应上欧洲的下午和北美的上午——不管你自己身处哪个时区。

打开一个没有候诊室、也没有把优先权卖给别人的聊天。

打开无限制聊天

AI限制从何而来