Mini-Projeto · Quiosque interativo com inteligência artificial
Contexto
O "Museu da Cidade" vai inaugurar uma sala interativa e encomendou-te um quiosque com inteligência artificial para os visitantes: reconhece objetos numa vitrine através da câmara, gera um retrato do visitante "no estilo" de uma obra em exposição, e produz legendas automáticas para um pequeno vídeo de apresentação. Foste contratado/a para planear, integrar e testar a aplicação, num protótipo funcional apresentado à direção do museu.
Trabalhas individualmente ou a pares. Entregas a aplicação a funcionar (ou um protótipo fiel em ferramenta de prototipagem, quando o hardware não estiver disponível) mais um dossiê de planeamento com as decisões tomadas.
Requisitos
Funcionais
- Planeamento documentado: as cinco perguntas do planeamento (problema, modalidade de IA, modelo/serviço, interação, recursos) respondidas para cada funcionalidade.
- Reconhecimento de objetos: identificar, pela câmara, pelo menos 3 peças diferentes de uma "vitrine" simulada (objetos reais ou imagens).
- Geração de imagem: gerar um retrato do visitante "no estilo" de uma obra, a partir de uma fotografia captada na aplicação.
- Legendas automáticas: gerar e sincronizar legendas para um vídeo curto (1 a 3 minutos) de apresentação da exposição.
- Interface de visitante: ecrã simples e guiado, sem necessidade de instruções escritas longas.
Não-funcionais
- Tempo de resposta aceitável: cada funcionalidade responde em poucos segundos, sem o visitante ficar à espera sem feedback.
- Aviso de utilização de IA: o visitante é informado sempre que uma imagem ou texto é gerado por IA.
- Privacidade: nenhuma fotografia do visitante é guardada sem consentimento explícito.
- Registo do consumo de recursos: tempo de resposta e, se possível, uso de memória de cada funcionalidade, documentado no dossiê.
Fases
Fase 1 · Planeamento da conceção (3h) Responder às cinco perguntas do planeamento para cada uma das três funcionalidades (objetos, geração de imagem, legendas). Escolher modelos/serviços concretos e justificar a escolha entre biblioteca local e API na nuvem.
Fase 2 · Reconhecimento de objetos (4h) Integrar um modelo de deteção de objetos, testar com pelo menos 3 peças da vitrine simulada, e definir um limite de confiança mínimo para mostrar o resultado ao visitante.
Fase 3 · Geração de imagem (4h) Integrar um modelo generativo de imagem, captar a fotografia do visitante, enviar o pedido (prompt) de estilo e mostrar o resultado, com o aviso de que é gerado por IA.
Fase 4 · Legendas automáticas (3h) Extrair o áudio do vídeo de apresentação, gerar as legendas via serviço de reconhecimento de voz, e rever manualmente os erros de vocabulário técnico ou nomes próprios.
Fase 5 · Interface e integração (3h) Ligar as três funcionalidades num percurso único e guiado para o visitante, com feedback visual durante cada espera.
Fase 6 · Testes, privacidade e recursos (2h) Testar com utilizadores reais fora da equipa; medir tempo de resposta de cada funcionalidade; confirmar que nenhuma fotografia fica guardada sem consentimento.
Fase 7 · Apresentação (1h) Demonstrar o quiosque à turma, explicando as decisões do dossiê de planeamento e os limites conhecidos da solução.
Critérios de avaliação
| Critério | Peso |
|---|---|
| Planeamento da conceção, completo e justificado | 15% |
| Reconhecimento de objetos funcional | 20% |
| Geração de imagem funcional e com aviso ao visitante | 20% |
| Legendas automáticas geradas e revistas | 15% |
| Interface, tempo de resposta e privacidade | 20% |
| Dossiê e apresentação | 10% |
Erros comuns
- Escolher os modelos ou APIs antes de terminar o planeamento da conceção.
- Não definir um limite de confiança mínimo, mostrando ao visitante deteções erradas com frequência.
- Gerar imagens sem avisar o visitante de que são produzidas por IA.
- Publicar legendas automáticas sem revisão humana.
- Deixar o ecrã "parado", sem feedback, enquanto o modelo processa o pedido.
- Guardar fotografias do rosto do visitante sem consentimento explícito.
- Nunca testar com um dispositivo real, só num computador potente de desenvolvimento.
- Ignorar o consumo de recursos e o tempo de resposta no planeamento inicial.
Bónus (opcional)
- Adicionar reconhecimento facial para saudar visitantes recorrentes (com consentimento explícito e opção de recusa).
- Integrar um elemento de realidade aumentada, sobrepondo informação da obra sobre a imagem da câmara.
- Traduzir automaticamente as legendas para uma segunda língua, para visitantes estrangeiros.
- Medir e apresentar, no dossiê, o consumo energético aproximado de cada funcionalidade ao longo de um dia de funcionamento.
Reflexão
No dossiê final, responde: porque é que o planeamento da conceção tem de vir antes de escolher qualquer modelo ou API concreta? E que duas decisões tomaste especificamente para proteger a privacidade dos visitantes do museu?