PESQUISA DE PONTA · 2026

Qwen nos bancos.

O estado da arte medido pela ciência: agentes autoevolutivos em e-banking, conformidade regulatória, prevenção à lavagem de dinheiro, antifraude e auditoria de demonstrações financeiras — o que os estudos mais recentes comprovam (e o que ainda não funciona).

+0,10Ganho de utilidade de agentes com memória evolutiva (SkillOpt) em e-banking simulado — com contrapartida de segurança medida.
0,859Utilidade máxima alcançada pelo ReasoningBank sem elevar a taxa de sucesso de ataques — o melhor equilíbrio auditado.
48,3%Aprovação em fluxos regulados do SOPBench (incluindo compliance bancário) com modelo de 32B — igualando baselines 10× maiores.
5,9×Throughput em workloads de PLD/AML após ajuste de serving: de 612–650 para 3.600 requisições por hora.

Sete marcos da pesquisa com Qwen aplicada à banca

arXiv
Agentes · ago/2026

Auditing Self-Evolution in Financial Agents

Auditoria dos frameworks de memória evolutiva SkillOpt, AWM e ReasoningBank em e-banking simulado sobre o Qwen 3.7 Flash. SkillOpt elevou a utilidade benigna de 0,741 para 0,837 — mas a exposição a conteúdo injetado subiu de 0,820 para 0,943 e a taxa de sucesso de ataques de 0,496 para 0,530. O ReasoningBank alcançou 0,859 de utilidade sem elevar a taxa agregada de ataques. Conclusão central: auditar agentes financeiros exige rastrear regressões, superfície de ataque, mudanças não autorizadas de estado financeiro e compatibilidade artefato-executor — acurácia sozinha não basta.

Ler no arXiv
KBTG
Banco de verdade · jan/2026

THaLLE-ThaiLLM: LLMs especializados em finanças pelo KBTG

O laboratório do banco tailandês KBTG demonstrou que model merging de Qwen-8B com ThaiLLM-8B e THaLLE-CFA-8B produz um modelo multicapacidade com ganhos simultâneos em benchmarks gerais e financeiros (Flare-CFA, Thai-IC). O estudo reforça por que bancos preferem deploy on-premise — privacidade, segurança e regulação — e apresenta o merge de modelos como alternativa eficiente ao treinamento de um modelo único monolítico.

Ler no arXiv
arXiv
Compliance · fev/2026

SOPBench: conformidade com procedimentos operacionais padrão

Benchmark de raciocínio sobre POPs em sete domínios regulados — incluindo bancos, com obrigações de compliance regulatório. O baseline Qwen-2.5-72B-Instruct alcançou 34,4% de aprovação; o método FM SO.P, com mistura progressiva de tarefas e avaliação multiagente, levou um modelo de 32B a 48,3% — mesmo desempenho com 10× menos parâmetros. Evidência de que raciocínio sobre processos e restrições, não tamanho, é o gargalo em fluxos bancários regulados.

Ler no arXiv
IEEE
Antifraude · jun/2026

Detecção de golpes em chamadas telefônicas com Qwen

No IEEE S&P 2026, pesquisadores avaliaram sete LLMs — incluindo Qwen Max, Plus e Turbo — no primeiro dataset público de 100 pares áudio-transcrição de chamadas de golpe em língua de baixos recursos. Resultado-chave para a banca: entradas baseadas em transcrição superam consistentemente o processamento direto de áudio, e transcrições corrigidas por humano performam de forma equivalente às não corrigidas — viabilizando pipelines de prevenção a fraudes em tempo quase real.

Ler no arXiv
arXiv
Auditoria · jun/2026

AuditFraudBench: julgamento de auditoria em demonstrações financeiras

Benchmark construído a partir de filings reais (10-K e 10-Q originais e re-apresentados, MD&A e AAERs da SEC) que avalia GPT, DeepSeek e Qwen em três tarefas: atribuição da fonte do resultado reportado, detecção de narrativas enganosas e classificação de mecanismos de fraude. Achado honesto e relevante: modelos abertos e proprietários ainda enfrentam dificuldade em raciocinar conjuntamente sobre números, framing de disclosure, evidências de restatement e mecanismos de manipulação — o humano permanece no loop.

Ler no arXiv
arXiv
PLD/AML · mai/2026

Servindo LLMs regulados em workloads de prevenção à lavagem de dinheiro

Estudo de engenharia de inferência sobre workloads de AML: com ajuste consciente de carga e quality gates determinísticos, o throughput saltou de 612–650 para 3.600 requisições/hora, a latência P99 caiu de 31–38 s para 6,4–8,7 s e a utilização de GPU subiu de 12% para 78%. A lição para bancos: performance em domínio regulado é problema de design de workload e serving — não apenas de escolha de modelo.

Ler no arXiv
arXiv
Conhecimento · ago/2026

WikiResearcher-9B: navegação em corpora estruturados com RL sobre Qwen

Agente WikiResearcher-9B, otimizado com reinforcement learning sobre um Qwen 9B, sintetiza corpora em wikis hierárquicas navegáveis e supera baselines não treinados do mesmo tamanho — igualando ou superando modelos externos maiores — em avaliações que incluem o FinanceBench, referência de perguntas e respostas sobre relatórios financeiros. Aplicação direta: consulta estruturada a regulatórios, manuais internos e documentações bancárias extensas.

Ler no arXiv

O que isso significa para a operação bancária

Memória evolutiva exige auditoria por padrão

Agentes que aprendem com a experiência ganham utilidade — e ampliam a superfície de ataque. Bancos devem medir regressão, contato com conteúdo injetado e mudanças não autorizadas de estado financeiro em cada ciclo de evolução.

Modelos abertos, deploy on-premise

O caminho validado pelo KBTG: partir de pesos abertos Qwen e especializar via merge ou fine-tuning local, preservando dados sob a governança do banco — requisito de privacidade e regulação.

Compliance é raciocínio de processo

O gargalo no SOPBench não foi tamanho, e sim procedimento: misturas progressivas de tarefas e avaliação multiagente com rubricas elevaram um modelo de 32B ao nível de um 72B em fluxos regulados.

Fraude é multimodal — e a transcrição vem primeiro

Na detecção de golpes em ligações, transcrições superaram áudio bruto em todos os cenários testados. Pipeline recomendado: ASR para texto e depois o LLM de decisão, com modelos Qwen Max/Plus/Turbo por custo e latência.

Fontes primárias: arXiv (2608.17684, 2601.04597, SOPBench/FM SO.P, 2606.24523, 2606.08345, 2605.07156, 2608.29953) e IEEE S&P 2026. Os resultados citados são dos respectivos estudos, em seus próprios cenários de teste, e não constituem garantia de desempenho em produção. A Ativo Cloud é uma integradora independente: Qwen é marca do ecossistema Qwen/Alibaba Group, e as marcas citadas pertencem aos seus titulares.

PRÓXIMO PASSO

Compare tecnologias.
Decida com contexto.

Solicitar proposta