Partilhar: WhatsApp
aulify · Sebenta
UC · Unidade de Competência · UC04378

Sebenta · Criar aplicações interativas com recurso a inteligência artificial (UC04378)

De pensamento computacional a visão, voz, geração de conteúdo e realidade aumentada
25h · 2.25 pontos crédito Curso: T. Produção de Conteúdos I ↗ Referencial oficial SNQ
Índice

Introdução

Esta sebenta ensina a planear, integrar e testar inteligência artificial (IA) dentro de aplicações interativas: instalações de museu, apps móveis, quiosques, experiências de realidade aumentada. Não vamos construir modelos de IA de raiz, isso é trabalho de investigação especializada, vamos integrar modelos já treinados em produtos reais, através de bibliotecas e APIs, com rigor técnico e responsabilidade ética.

O percurso segue a lógica do referencial: primeiro os fundamentos (pensamento computacional, evolução da IA, machine learning, deep learning, treino e avaliação de modelos), depois cada tipo de integração concreta (reconhecimento de objetos, reconhecimento facial, geração de arte e vídeo, legendas automáticas, realidade aumentada e virtual) e por fim as ferramentas transversais (frameworks, bibliotecas, APIs, segurança e ambiente).

Objetivos de aprendizagem (referencial): planear a conceção de aplicações interativas com IA; integrar modelos de IA para reconhecimento de objetos, reconhecimento facial, criação de arte, imagens e vídeos; criar legendas automáticas; integrar IA em aplicações de realidade aumentada e realidade virtual.

1. Pensamento computacional

O pensamento computacional é o método de raciocínio que precede qualquer solução técnica, incluindo uma aplicação com IA. Assenta em quatro pilares que se repetem em todos os projetos desta UC:

Exemplo resolvido: decompor um problema real

Uma loja quer uma aplicação que avisa quando uma prateleira está vazia, através de uma câmara fixa.

  1. Decompor: captar imagem periodicamente → detetar a prateleira → contar os produtos visíveis → comparar com o stock mínimo → alertar se abaixo do limite.
  2. Padrão: é o mesmo raciocínio de "contar objetos numa imagem" usado noutras aplicações (contagem de pessoas, de veículos).
  3. Abstração: não interessa a marca exata do produto, só se o espaço está ocupado ou vazio.
  4. Algoritmo: um ciclo que corre a cada 5 minutos, chama o modelo de deteção, compara a contagem e dispara o alerta.

Este raciocínio, feito antes de escolher qualquer ferramenta, poupa retrabalho e evita escolher um modelo desadequado ao problema.

2. Evolução e conceitos da inteligência artificial

A inteligência artificial (IA) é a capacidade de um sistema realizar tarefas que, tipicamente, exigiam inteligência humana: reconhecer, decidir, gerar, comunicar.

Uma linha do tempo resumida

Período O que aconteceu
1950-60 nasce o termo "inteligência artificial"; primeiros sistemas baseados em regras
1980-90 sistemas periciais, primeiras redes neuronais, pouca capacidade de cálculo
Anos 2010 explosão do deep learning, mais dados e mais poder de cálculo (GPU)
Hoje modelos generativos, assistentes de voz, visão computacional em tempo real, tudo acessível por API

Os conceitos centrais que sustentam esta UC

Estes quatro conceitos combinam-se, em proporções diferentes, em todas as aplicações de IA que a UC estuda.

3. Machine learning: princípios e algoritmos

Em machine learning, o modelo aprende a partir de exemplos (dados). Distinguem-se três formas de aprendizagem:

Tipos de algoritmo, por objetivo

Tipo Objetivo Exemplo aplicado
Classificação atribuir uma categoria a um exemplo "há uma pessoa com capacete" ou "sem capacete"
Regressão prever um valor numérico contínuo prever o tempo de fila numa exposição
Agrupamento (clustering) juntar exemplos semelhantes, sem categorias prévias segmentar visitantes por padrão de movimento

Exemplo resolvido: escolher o algoritmo certo

Uma galeria de arte quer saber, a partir de sensores de movimento, quantos grupos distintos de visitantes passam pela exposição num dia, sem saber à partida quantos tipos existem.

Resolução: trata-se de agrupamento (clustering), não classificação, porque não há categorias definidas antecipadamente; o algoritmo é que descobre os grupos a partir dos dados de movimento recolhidos.

4. Deep learning e redes neuronais

Deep learning é machine learning com redes neuronais de muitas camadas. É a técnica por trás da visão computacional, da geração de imagem e dos assistentes de voz modernos.

Da rede totalmente ligada à rede convolucional

Na prática profissional, raramente se desenha uma rede de raiz: usam-se modelos pré-treinados, disponibilizados por bibliotecas ou APIs, que já resolveram este desenho.

5. Treinar e avaliar modelos de IA

Treinar um modelo é ajustar os seus parâmetros até acertar o máximo possível, sem "decorar" os dados de treino (overfitting).

Passo a passo do treino

  1. Preparar os dados: recolher, limpar e rotular, depois dividir em conjuntos de treino, validação e teste.
  2. Escolher a arquitetura: o tipo de rede ou algoritmo adequado ao problema.
  3. Treinar: o modelo ajusta os pesos ao longo de várias iterações (épocas).
  4. Validar: testar em dados que o modelo não viu, para detetar overfitting.
  5. Ajustar hiperparâmetros e repetir até o desempenho estabilizar.

Avaliar desempenho e generalização

Critério de desempenho da UC: verificar a capacidade dos modelos de IA em generalizar para diferentes conjuntos de dados.

Exemplo resolvido: overfitting

Um modelo de deteção de defeitos numa fábrica acerta 99% nas fotos de treino, mas falha metade das vezes com fotos novas da própria linha.

Resolução: é um caso clássico de overfitting, o modelo memorizou padrões específicos das fotos de treino em vez de aprender características gerais do defeito. A correção passa por mais dados de treino variados, técnicas de regularização e, sobretudo, validar sempre com dados que o modelo nunca viu.

6. Planear uma aplicação interativa com IA

Realização central da UC: planear a conceção de aplicações interativas com inteligência artificial. O planeamento antecede sempre a escolha da ferramenta.

As cinco perguntas do planeamento

  1. Que problema resolve a interação? (reconhecer, gerar, legendar, sobrepor conteúdo).
  2. Que modalidade de IA serve o problema? (visão, voz, texto, geração de imagem, ou combinações).
  3. Que modelo ou serviço integrar? Treinar de raiz é raro; escolhe-se um modelo pré-treinado ou uma API.
  4. Como se desenha a interação? Input do utilizador (câmara, microfone, ecrã tátil), tempo de resposta esperado, output.
  5. Que recursos são necessários? Dispositivo, ligação à internet, licenças, limites de uso da API, orçamento.

Do protótipo ao produto interativo

Uma aplicação interativa com IA só está pronta quando o modelo, a interface e a experiência funcionam como um todo coerente.

7. Integrar reconhecimento de objetos em imagens

Realização da UC: integrar modelo de IA para reconhecimento de objetos em imagens. A visão computacional ensina o computador a interpretar imagens.

Tarefas de visão computacional

Tarefa O que faz
Classificação de imagem atribui uma categoria a toda a imagem
Deteção de objetos localiza e identifica vários objetos, com caixas delimitadoras
Reconhecimento de texto (OCR) lê texto dentro de uma imagem
Reconhecimento de sons classifica um som ou padrão de áudio

Exemplo resolvido: deteção de equipamento de proteção

Uma app de segurança numa obra deve identificar, pela câmara, trabalhadores sem capacete.

  1. Escolher um modelo pré-treinado de deteção de objetos (ex.: uma família de modelos de deteção em tempo real, ou um serviço de visão em nuvem).
  2. Ligar a câmara ao fluxo da aplicação e enviar cada imagem (ou frame) ao modelo, via API ou biblioteca.
  3. Receber a resposta: lista de objetos detetados, com classe, posição na imagem e grau de confiança.
  4. Desenhar as caixas e etiquetas sobre a imagem na interface da aplicação.
  5. Aplicar uma regra de negócio: alertar se for detetada uma pessoa sem capacete.
  6. Registar o grau de confiança de cada deteção e definir um limite mínimo para disparar o alerta, evitando falsos positivos.

8. Segmentação semântica em redes convolucionais

A segmentação semântica vai além da deteção de objetos: em vez de uma caixa à volta do objeto, classifica cada pixel da imagem segundo a classe a que pertence. Aptidão da UC: usar algoritmos de segmentação para isolar objetos.

Onde a segmentação aparece nesta UC

A segmentação liga, tecnicamente, o reconhecimento de objetos (Capítulo 7) à realidade aumentada e virtual (Capítulo 11): primeiro localiza-se o objeto, depois separa-se pixel a pixel para o manipular.

9. Integrar reconhecimento facial

Realização da UC: integrar modelo de IA para reconhecimento facial. Aptidão associada: aplicar algoritmos de IA para identificar e analisar características faciais.

Como funciona, passo a passo

  1. Deteção da face: localizar a região da cara dentro da imagem.
  2. Extração de características: medir pontos-chave (olhos, nariz, boca, contorno) e representá-los como um vetor numérico.
  3. Comparação: comparar esse vetor com uma base de dados de rostos conhecidos.
  4. Decisão: identificar a pessoa entre várias (1:N) ou verificar se é quem diz ser (1:1), sempre com um grau de confiança associado.

Ética e limites do reconhecimento facial

Atitude da UC diretamente ligada a este tema: responsabilidade pelas suas ações. Um técnico competente sabe implementar reconhecimento facial e sabe também reconhecer quando não o deve usar.

Exemplo resolvido: identificação vs verificação

Um museu quer que os visitantes com bilhete "amigo" sejam reconhecidos automaticamente à entrada, sem cartão.

Resolução: é um problema de verificação (1:1), não de identificação aberta (1:N): o sistema compara o rosto captado com o rosto associado ao bilhete específico que a pessoa apresenta (por QR code, por exemplo), em vez de o comparar com toda a base de visitantes. Isto reduz falsos positivos e limita a quantidade de dados pessoais tratados.

10. Criação de arte, imagens e vídeo com IA generativa

Realização da UC: integrar modelo de IA para criação de arte, imagens e vídeos. Aptidão associada: incorporar modelos generativos.

Tipos de geração

Exemplo resolvido: retrato interativo num museu

Um quiosque de museu deve gerar, em segundos, um retrato do visitante "no estilo" de uma das obras em exposição.

  1. O visitante tira uma fotografia na câmara do quiosque.
  2. A aplicação envia a fotografia e um pedido (prompt) de estilo ao modelo generativo, via API.
  3. O modelo devolve a imagem gerada, tipicamente em poucos segundos.
  4. A aplicação mostra o resultado e oferece a opção de o visitante o descarregar.
  5. Informa-se sempre o visitante de que a imagem foi gerada por IA, e o rosto original não é guardado sem consentimento.

11. Voz: reconhecimento e legendas automáticas

Os sistemas de reconhecimento de voz convertem fala em texto (speech-to-text), base dos assistentes de voz e das legendas automáticas. Realização da UC ligada a este tema: criar legendas automáticas.

Como funciona o reconhecimento de voz

  1. Captura de áudio: o microfone recolhe o sinal sonoro.
  2. Pré-processamento: remoção de ruído, normalização do volume.
  3. Modelo de reconhecimento: converte o áudio em texto, com técnicas de processamento de sequência.
  4. Pós-processamento: pontuação, capitalização e correção de erros frequentes.

Exemplo resolvido: gerar legendas automáticas para um vídeo

Uma escola quer legendar automaticamente os vídeos das aulas gravadas, para acessibilidade.

  1. Extrair o áudio do vídeo.
  2. Enviar o áudio a um serviço de reconhecimento de voz, via API.
  3. Receber o texto já com marcas de tempo (timestamps) associadas a cada trecho.
  4. Gerar o ficheiro de legendas, num formato compatível (por exemplo .srt), sincronizado com o vídeo.
  5. Rever manualmente termos técnicos e nomes próprios, que o modelo erra com mais frequência.

Legendas automáticas melhoram diretamente a acessibilidade da aplicação para pessoas surdas ou com dificuldade auditiva, mas exigem sempre revisão humana antes de publicar.

12. Sistemas de processamento de vídeo

Um vídeo é uma sequência de imagens (frames) no tempo, muitas vezes com áudio associado. O processamento de vídeo combina as técnicas de imagem já estudadas, aplicadas repetidamente.

Desempenho e recursos

Critério de desempenho da UC: avaliar o consumo de recursos durante a execução de modelos de IA para garantir eficiência. Vídeo em direto exige processar dezenas de frames por segundo em tempo real. Trocas possíveis para ganhar velocidade: menor resolução, menos frames por segundo, ou um modelo mais leve. Mede-se sempre tempo de resposta, uso de memória e, em dispositivos móveis, consumo de bateria.

13. Realidade aumentada e realidade virtual com IA

Realização da UC: integrar IA em aplicações de realidade aumentada (RA) e de realidade virtual (RV).

RA vs RV

Como a IA entra numa aplicação de RA/RV

  1. Deteção e segmentação: reconhecer superfícies, objetos ou pessoas no ambiente real (essencial em RA).
  2. Seguimento (tracking): manter o elemento digital "colado" ao ponto certo enquanto a câmara ou a cabeça do utilizador se move.
  3. Reconhecimento de gestos ou de voz: permitir interação sem teclado nem rato.
  4. Geração de conteúdo: criar texturas, avatares ou cenários com IA generativa para enriquecer a experiência virtual.

Exemplo resolvido: provador virtual

Uma loja quer um provador virtual de óculos: o cliente vê, na câmara do telemóvel, como ficaria com cada modelo.

Resolução: o fluxo combina deteção facial (Capítulo 9) para localizar os pontos-chave da cara, seguimento (tracking) para manter o modelo 3D dos óculos ajustado enquanto o cliente se mexe, e renderização em tempo real para sobrepor a imagem. É um exemplo direto de como as técnicas anteriores da UC se combinam numa única aplicação de realidade aumentada.

14. Frameworks, bibliotecas e APIs

Um framework de IA é um conjunto de ferramentas de software que facilita construir, treinar e usar modelos. Aptidão da UC: utilizar diferentes tipos de bibliotecas e APIs.

Treino vs inferência

Fase O que se usa Frequência nesta UC
Treino frameworks completos, para criar e ajustar modelos de raiz rara
Inferência versões otimizadas e leves, para correr um modelo já treinado comum

Na maioria dos projetos desta UC, usa-se inferência: o modelo já vem treinado por terceiros, a aplicação só o consome através de uma biblioteca ou de uma API.

Biblioteca local vs API na nuvem

Biblioteca / modelo local API na nuvem
Ligação à internet não obrigatória obrigatória
Custo licença ou gratuito, sem custo por pedido normalmente por pedido/uso
Privacidade dos dados ficam no dispositivo saem para o serviço externo
Atualizações do modelo manuais automáticas pelo fornecedor

A escolha certa depende sempre do contexto do planeamento (Capítulo 6): uma instalação sem internet exige modelo local; um protótipo rápido beneficia de uma API na nuvem.

15. Segurança, saúde no trabalho e proteção ambiental

Normas de segurança e saúde no trabalho

Trabalhar com câmaras, sensores e computação intensiva (treino e inferência de modelos) exige atenção redobrada:

Normas de proteção ambiental

Modelos de IA, sobretudo no treino, consomem energia e recursos computacionais significativos:

Atitudes da UC que atravessam todo este capítulo: rigor, responsabilidade e respeito pelas regras e normas definidas.

Erros comuns

Glossário

Síntese

Criar aplicações interativas com IA segue sempre a mesma lógica: pensamento computacional e fundamentos de IA (machine learning, deep learning, treino e avaliação) dão a base; planear a conceção vem sempre antes de escolher modelo ou API; depois integram-se técnicas concretas, visão (objetos, segmentação, faces), geração (arte, imagens, vídeo), voz (reconhecimento, legendas) e vídeo; a realidade aumentada e virtual combina várias destas técnicas em tempo real; e tudo assenta em frameworks, bibliotecas e APIs, escolhidos com rigor, segurança e responsabilidade ambiental.

Exercícios resolvidos

1. Uma app deve contar quantas pessoas entram numa loja através de uma câmara à entrada. Qual a primeira coisa a fazer, antes de escolher qualquer modelo de IA?

Resolução: aplicar pensamento computacional: decompor o problema (captar imagem, detetar pessoas, contar entradas únicas, evitar contar a mesma pessoa duas vezes), reconhecer que é semelhante a outros problemas de contagem, e só depois de todo esse raciocínio escolher o modelo de deteção adequado.

2. Que tipo de aprendizagem automática se usa quando os dados de treino já trazem a resposta certa, como fotos rotuladas "com capacete" e "sem capacete"?

Resolução: aprendizagem supervisionada. Os dados de treino incluem o rótulo correto para cada exemplo, permitindo ao modelo aprender a associação entre a imagem e a categoria.

3. Um modelo de deteção de defeitos acerta 99% nas fotos de treino, mas falha metade das vezes com fotos novas. Que problema é este e como se resolve?

Resolução: é overfitting: o modelo memorizou as fotos de treino em vez de aprender características gerais do defeito. Resolve-se com mais dados de treino variados, técnicas de regularização, e validando sempre com dados que o modelo nunca viu.

4. Diferencia deteção de objetos e segmentação semântica, e dá um exemplo de uso de cada uma numa aplicação interativa.

Resolução: a deteção de objetos localiza e identifica objetos com uma caixa delimitadora (ex.: assinalar onde está cada pessoa numa imagem de segurança). A segmentação semântica classifica cada pixel (ex.: separar exatamente o contorno de uma pessoa para lhe trocar o fundo numa videochamada). A segmentação é mais precisa e mais exigente em recursos.

5. Uma app de museu gera um retrato do visitante "no estilo" de um quadro da exposição. Que tipo de modelo de IA está a ser usado, e que cuidado ético deve ter?

Resolução: um modelo generativo (geração de imagem a partir de texto/imagem, com transferência de estilo). Cuidado ético: informar o visitante de que a imagem é gerada por IA e não guardar o rosto original sem o seu consentimento explícito.

6. Porque é que legendas automáticas nunca devem ser publicadas sem revisão humana?

Resolução: porque os sistemas de reconhecimento de voz erram com mais frequência em vocabulário técnico, nomes próprios e ambientes com ruído, e legendas erradas prejudicam diretamente quem depende delas para aceder ao conteúdo, sobretudo pessoas surdas ou com dificuldade auditiva.

7. Uma aplicação de realidade aumentada para provar óculos precisa de que combinação de técnicas de IA vistas na UC?

Resolução: deteção/reconhecimento facial para localizar os pontos-chave da cara, seguimento (tracking) para manter o modelo 3D ajustado enquanto o utilizador se mexe, e processamento em tempo real com atenção ao consumo de recursos, para não travar nem aquecer o dispositivo.

8. Uma instalação interativa vai funcionar num local sem ligação à internet. Deve integrar um modelo local ou uma API na nuvem, e porquê?

Resolução: modelo local, porque uma API na nuvem exige ligação à internet para funcionar. Esta decisão faz parte do planeamento da conceção da aplicação, feito antes de escolher a ferramenta técnica concreta.