o vLLM é um motor de inferência e serviço para modelos de línguas grandes (LLMs). De 0.18.0 para antes 0.20.0, o proponente de decodificação especulativa extract_hidden_states no vLLM retorna um tensor com uma forma incorreta após o primeiro passo de decodificação, causando um Erro de execução que bloqueia o processo EngineCore. O crash é acionado quando qualquer pedido no lote usa parâmetros de penalização de amostragem (repetição_penalty, frequency_penalty, ou presence_penalty). Um único pedido com um parâmetro de penalização (por exemplo, "repetion_penalty": 1.1 ) é suficiente para bloquear o servidor. Esta vulnerabilidade está fixada em 0.20.0. O registro de base de dados de vulnerabilidade nacional CVE- 2026 - 44223 foi publicado em 2026 - 05 - 12 T 20: 16: 43.293 Z e última modificação em 2026 - 06 - 22 T 22: 16: 45.507 Z. O seu estado registrado é modificado.
métricas de vulnerabilidade gravadas: CVSS 3.1, pontuação de base 6.5, gravidade MEDIUM, vetor CVSS: 3.1 /AV:N/AC:L/PR:L/UI:N/S:U/C:N/I:N/A:H, pontuação de exploração 2.8, pontuação de impacto 3.6; CVSS. Classificações de fraqueza associadas: CWE- 131, CWE- 704.
Os produtos ou plataformas nomeados nos dados de aplicabilidade incluem: vllm vllm. O registro NVD inclui referências de suporte documentando a vulnerabilidade, tecnologia afetada ou informações de remediação.