为什么回答会变短或变慢
输出预算,限制了单条回复能有多长。上下文窗口,限制了模型还能看到多少之前的对话内容。限速,在硬件繁忙时拖慢传输速度。第一种让回答变短,第二种让它变得健忘,第三种只是让它来得晚。
人们会把这三种情况都描述成“助手变差了”,而这三者除了给人的感觉相似之外,没有任何共同点。把它们区分开来,能把一句模糊的抱怨,变成一件你可以真正采取行动的事。
输出预算削减的是回复,不是记忆
每项服务都会为单条回复设置一个最大长度,用token而不是字数来衡量。回复一旦达到这个长度,生成就会停止,有时甚至停在半句话中间。模型其实还“知道”剩下的内容,只是不被允许写出来。让它继续通常有效,因为这个预算是按每条回复计算的,而不是按整段对话计算的。
上下文窗口让模型忘记开头
这个窗口,就是模型还能读到多少之前的文字。当一段长对话超出这个窗口时,最早的消息就会从视野中消失。模型之后的回答,会表现得好像从未见过那些内容——这看起来像是粗心,实际上是一个天花板。开一段新对话、附上一段简短摘要能解决这个问题;要求模型“再努力一点”解决不了。
限速只改变速度,别的什么都不改变
硬件繁忙时,token到达的速度会变慢。回答本身还是同一个回答,只是送达得晚了。如果文字完整、内容正确,只是速度很慢,那你碰到的天花板就是容量问题,负载降下来之后它会自己消失。
用一个问题,判断你碰到的是哪一种
问问自己:这个回答是短、是健忘,还是慢?短,指向输出预算,让它继续通常有效。健忘,指向窗口,开一段新对话有效。慢,指向限速,等一等就有效。这三种解决方法各不相同,这也是为什么花一点时间认清自己碰到的是哪种天花板,是值得的。
合理的疑问
更长的问题会让回答变短吗?
有可能。问题和回答共享同一个窗口,所以在把两者放在一起计算预算的服务上,一个很长的问题会给回答留下更少的空间。
被截断的回答算是一个故障吗?
通常不算,这只是输出预算在正常发挥作用。真正的故障看起来会是回答直接停住、而且完全没法续写。
付费套餐能获得更大的窗口吗?
通常可以,因为更大的窗口运行成本更高。这是少数几个付费真正改变的是能力本身、而不只是数量的地方之一。
问一个很长的问题,看看这个聊天会不会在哪里停下来。
打开无限制聊天