Integração do SAP AI Core e do SAP AI Launchpad
Descrição de operações de treinamento de modelo
Descrição de operações de inferência de modelo

Atendendo a um modelo de ML

Objective

After completing this lesson, you will be able to implementar um modelo de ML no SAP AI Core e usar o URL de implementação para inferência

Implementação de modelo no SAP AI Core

Após um modelo ser treinado, ou seja, ele aprendeu (oculto) padrões a partir do conjunto de dados fornecido, o modelo precisa ser implementado. Ao implementar o modelo, é possível enviar novos dados para o modelo e obter uma "previsão" para o registro de dados indicado. Isso também é chamado de Servindo Modelo ou Inferenciando.

Um cluster Kubernetes pode ser configurado para fornecer contêineres de CPU (baratos) e GPU para o Model Serving.

Além disso, um grande número de solicitações pode ser enviado ao Model Server ao mesmo tempo. Para processar essas solicitações de "inferência" em tempo hábil, o Kubernetes permite escalar o Model Server "sob demanda".

Aqui temos 2 casos:

  • Autoscaling: adicionando (clonagem) novos recipientes sob demanda.

  • Escala para zero: permite eficiência de custo e pagamento por uso, desligando contêineres ociosos.

A implementação de um modelo no SAP AI Core consiste em escrever um aplicativo da Web capaz de atender às solicitações de inferência por meio de um ponto de acesso exposto na Internet, que pode ser facilmente escalado na infraestrutura do Kubernetes.

Etapas para implementar um modelo treinado: envie um Modelo de atendimento para obter o URL de implementação, que pode ser usado em qualquer app para inferência de modelo.

Aplicação servindo

Para servir um modelo, você codifica e desenvolve uma aplicação de serviço que será executada na forma de um container.

Tudo começa com uma solicitação de inferência enviada para um ponto de acesso. Internamente, o aplicativo da Web deve interpretar os dados contidos no corpo da chamada e, em seguida, recuperar o modelo do armazenamento de objetos em hiperescala, aplicá-lo aos dados e embalar a previsão em uma resposta que será consumida por um serviço personalizado.

Descrição do fluxo de trabalho Serving Application: Quando os dados são recebidos pelo servidor do modelo, os dados podem ser pré-processados, por exemplo, normalizados antes de se alimentar no modelo e obter o resultado da inferência.

Nota

Embora existam diferentes formas de inferência (ou seja, inferência em lote), estamos principalmente analisando a inferência online com um ponto de acesso exposto (API AI) que o usuário final chama usando uma solicitação http.

A codificação é fundamental, mas, como mencionado anteriormente, o servidor do modelo que será implementado é definido por um modelo específico. Este modelo autônomo criará um executável com a definição dos parâmetros necessários, o container a ser executado, os recursos necessários para iniciar a aplicação Web e o número de réplicas do servidor de modelo a ser iniciado.

Essa combinação do executável de atendimento adequado, com a referência ao modelo a ser usado, permitirá que o SAP AI Core inicie sua implementação.

Quando o servidor do modelo está em execução e o URL de implementação está pronto, a etapa final do fluxo de trabalho de ML no SAP AI Core é o consumo do modelo por meio do ponto de acesso exposto. A API pode ser facilmente integrada em qualquer aplicativo de negócios usando uma solicitação http, como um notebook Jupyter, Postman ou um aplicativo CAP, etc.