Projetos›Detecção sintética
⌕
Linha de pesquisa 3 · Computação

Detecção robusta de conteúdo sintético

Investiga textos, imagens, áudio e vídeo gerados ou manipulados por IA, mesmo após compressão, edição, tradução e ataques deliberados. O sistema combina proveniência, sinais forenses, classificação probabilística, abstenção e testes reproduzíveis.

◎
Nota geral44
Aderência49
Rigor27
Reprodutibilidade60
Cobertura48
Robustez30
Validação independente0

Laboratório multimodal

Envie uma amostra ou cole um texto para uma análise demonstrativa.

▤

Cole um texto para análise

O demonstrador calcula sinais estilométricos, regularidade, repetição e incerteza. O conteúdo integral não é armazenado.

0,68

Modalidades e estado da implementação

Arquitetura preparada para fusão de evidências.

▤

Texto

Estilometria, TF-IDF, regressão logística, ataques de paráfrase, tradução e Unicode.

Baseline implementado
▧

Imagem

Metadados, resíduos de compressão, frequências, padrões de difusão e proveniência.

Baseline implementado
♫

Áudio

Espectrograma, prosódia, artefatos de vocoder, codecs e regravação.

Baseline implementado
▶

Vídeo

Coerência temporal, fluxo óptico, sincronização labial e consistência de identidade.

Baseline implementado
⌘

Proveniência

C2PA, assinaturas, marcas-d'água e histórico de transformação do arquivo.

Especificado
⚠

Detecção aberta

Humano, sintético conhecido, sintético desconhecido, manipulado ou inconclusivo.

Política de segurança
Experimento interativo

Laboratório de detecção sintética

A análise abaixo é demonstrativa e não deve ser usada isoladamente para acusação, sanção ou decisão de alto impacto.

▤

Análise textual e documental

Digite ou cole conteúdo enriquecido, ou envie TXT, PDF, DOCX, PPTX, planilha, HTML, Markdown, LaTeX, código e outros documentos.

Nenhum arquivo selecionado

A produção de evidência científica exige distinção entre resultados computacionais, argumentos teóricos e conclusões. Mesmo um desempenho elevado em uma amostra finita não demonstra validade universal fora do domínio avaliado.

0,68

Ensaios adversariais

Transformações que devem preservar o significado enquanto tentam remover sinais do gerador.

TransformaçãoEstadoVariação esperadaResultado
Remoção de pontuaçãonão executadoAlta—
Normalização Unicode NFKCnão executadoBaixa—
Truncamento de 25%não executadoMédia—
Embaralhamento localnão executadoAlta—
Ruído de espaçosnão executadoBaixa—
Caracteres invisíveisnão executadoMédia—
Caixa alternadanão executadoBaixa—
Repetição de frasesnão executadoAlta—
Formalização

Metodologia, hipóteses e equações

Cada fórmula declara variáveis, unidades, hipóteses auxiliares e domínio de validade.

Problema de decisão com abstenção

f(x) ∈ {humano, sintético conhecido, sintético desconhecido, manipulado, inconclusivo}

A saída “inconclusivo” é parte obrigatória do sistema. Ela reduz decisões excessivamente confiantes em amostras fora do domínio ou adversarialmente modificadas.

Probabilidade logística

p(y = 1 | x) = 1 / (1 + exp(−(wᵀx + b)))

TF-IDF

tfidf(t,d) = tf(t,d) · log((N + 1)/(df(t) + 1))

Hipóteses testáveis

H1 · Fusão de evidências

parcial

Combinar proveniência, sinais forenses e classificador estatístico reduz falso positivo sem perda extrema de cobertura.

H2 · Treinamento adversarial

parcial

Treinar com compressão, paráfrase, recodificação e ruído melhora robustez sob transformações não vistas.

H3 · Detecção aberta

especificada

Uma classe inconclusiva é mais segura do que a decisão binária obrigatória humano versus IA.

H4 · Generalização multimodal

pendente

Consistência entre áudio, vídeo e semântica fornece evidência complementar a detectores isolados.

Registro de variáveis

VariávelDefiniçãoUnidadeDomínioHipótese auxiliar
xVetor de características da amostraadimensionalℝⁿPré-processamento determinístico
pProbabilidade calibrada de conteúdo sintético0–1[0,1]Calibração válida no domínio
τLimiar de decisão0–1[0,1]Escolhido no conjunto de desenvolvimento
δLargura da zona de abstenção0–1[0,0,5]Custo de falso positivo conhecido
FPRTaxa de conteúdos humanos marcados como sintéticos%[0,100]Rótulos humanos confiáveis
CCobertura: fração de casos com decisão%[0,100]Abstenções registradas
Falsificação primeiro

Validação científica e busca de contraexemplos

A amostra finita produz evidência computacional, não prova universal.

Critérios objetivos de falha

F1

Acurácia estrita < 75%

Conta abstenção como falha de cobertura, evitando esconder desempenho baixo.

F2

Falso positivo humano > 5%

Protege autores humanos contra acusações indevidas.

F3

Pior ataque < 55%

Impede que a média oculte colapso completo em uma transformação.

F4

Generalização não vista < 60%

Avalia modelos, domínios e ataques que não participaram do treinamento.

F5

Desvio entre seeds > 2 p.p.

Resultados instáveis não sustentam uma conclusão científica forte.

Estado do protocolo

Testes automatizados

não executado

Unitários, integração, propriedades e asserts.

Busca de contraexemplos

não executado

Casos híbridos, textos curtos, Unicode, código e repetição extrema.

Reprodução independente

pendente

Exige outro ambiente ou equipe, com hashes e comandos registrados.

Revisão humana externa

pendente

Não pode ser automatizada nem autodeclarada pelo autor.

Resultados por baseline

Valores demonstrativos da massa interna atual; não representam validação no mundo real.

ModeloAcurácia estritaCoberturaPior ataqueConclusão
Heurístico v0.145,06%64,20%0,00%refutado
TF-IDF caracteres98,77%98,77%72,50%viés de domínio
TF-IDF palavras100,00%100,00%95,00%viés provável
TF-IDF combinado100,00%100,00%97,50%não universal
Publicação responsável

Artefatos, reprodução e submissão

O pacote deve permitir inspeção técnica, execução segura e citação dos dados.

▤

Artigo científico

Título, resumo, método, resultados, discussão, limitações e referências.

Estruturado
⌘

Código e ambiente

Node.js 24, Python 3.12, Docker Compose, locks e comandos.

Preparado
#

Dados e hashes

Schema, licença, origem, divisões, seeds e SHA-256.

Parcialmente citável

Comandos de reprodução

cp .env.example .env
docker compose up --build
python scripts/verify_line3_hashes.py
python scripts/run_proposal_validation.py
python scripts/run_counterexample_search.py

Destino de publicação

Autorização dos autores

não confirmada

A submissão externa requer confirmação humana explícita. Esta interface não publica automaticamente.

Comparação reproduzível

Benchmarks comparativos

Executa os baselines reais do serviço científico e apresenta métricas, seeds, dataset e limitações.

Estado da execução

Serviço científico

verificando

Aguardando verificação.

Dataset

—

linha3_text_ptbr_v1

Seed canônica

—

O relatório completo registra também a estabilidade entre seeds.

Interpretação obrigatória

Um benchmark alto neste corpus não prova detecção universal. Resultados podem refletir domínio, época, fonte, família de gerador e composição da amostra.

Melhor modelo observado

—

Execute o benchmark para carregar a evidência computacional.

Resultados dos baselines

Valores retornados diretamente por /api/synthetic-detection/benchmark/text/compare.

BaselineAcurácia estritaCoberturaFPR humanoPior ataqueSeed
Nenhum benchmark carregado.
Evidência técnica
Os detalhes de generalização e representatividade aparecerão após a execução.
Runtime e preferências

Configurações

Preferências locais do laboratório e diagnóstico dos serviços reais usados pela análise.

Preferências do laboratório

0,68

As preferências são salvas somente neste navegador e não alteram o protocolo científico do servidor.

Diagnóstico do ambiente

Node.js / API

verificando

—

Python científico

verificando

—

MySQL

verificando

—

Limites de análise

ModalidadeLimiteProcessamento
Texto/documento100 MBstreaming + extração documental
Imagem150 MBdecodificação por conteúdo real
Áudio500 MBFFmpeg + sinais espectrais
Vídeo2 GBFFmpeg + amostragem de quadros
Ação concluída.