我发现国内几个主流的大模型在遇到超长上下文时,对于临近对话的记忆效果特别特别差,刚叮嘱了一句什么之后,下一次同样的问题又开始自由发挥。盲猜注意力、KV-Cache、以及上下文压缩共同作用。 发布于 云南