Artykuły z tagiem
1 artykuł
ConStory-Bench mierzy błędy spójności w długich opowiadaniach LLM: GPT-5-Reasoning ma 0,113 błędu na 10 000 słów, a ludzcy eksperci wyłapują tylko 17,1% z nich.