O modelo flash da DeepSeek reduz necessidades de memória de IA e atinge ações de memória sul-coreanas
A DeepSeek anunciou o V4.1-Flash, um modelo de 552 bilhões de parâmetros que ativa 8 bilhões de parâmetros para entrada e 16 bilhões para saída, suporta uma janela de contexto de um milhão de tokens e lê imagens nativamente. Sua arquitetura reutiliza cache entre camadas, armazena o KV-cache com precisão de 4 bits e reconstrói valores sob demanda, gerando cerca de 890 bytes de cache por token e uma queda de 437 vezes na memória por token desde janeiro de 2024. o lançamento e as mudanças associadas de preços contribuíram para pressão de venda em Seul, onde Samsung e SK Hynix caíram após investidores precificarem menor demanda por memória por unidade para workloads de IA.
O V4.1-Flash reduz o cache para cerca de 890 bytes por token.
Contexto
A DeepSeek reduziu as exigências de KV-cache em várias liberações desde janeiro de 2024. Essa mudança reduz a memória necessária para executar sessões longas de IA e pode reduzir custos. A Micron divulgará resultados no dia 30 de setembro…
A análise completa
19 dimensões sobre esta notícia — impacto mundial, leitura de mercado e o que vem a seguir.
- Contexto completoBloqueado
- Setores afetadosBloqueado
- Impacto bolsistaBloqueado
- Indicador económicoBloqueado
- Relevância para investidoresBloqueado
- Relevância profissionalBloqueado
- Pontos a observarBloqueado
- Probabilidade de mudançaBloqueado
- Pontos de debateBloqueado
- Paralelo históricoBloqueado
- Conhecimento prévio necessárioBloqueado
- Perguntas de seguimentoBloqueado
- Prós e contrasBloqueado