A AMD continua expandindo suas ferramentas de software para computação de alto desempenho com o desenvolvimento do HRX System (Hip Runtime Extended). Atualmente em estágio de acesso antecipado, o projeto é uma infraestrutura de runtime que serve como implementação alternativa do HIP, operando dentro da atual pilha ROCm.
O objetivo central do HRX é fornecer uma base comum de baixa latência e alto desempenho para a integração com todo o portfólio de hardware da empresa, o que abrange GPUs, NPUs e processadores (CPUs). O projeto tem código aberto hospedado no GitHub e fornece aos desenvolvedores um ambiente flexível para testar e executar aplicações nativas desenvolvidas para a plataforma da AMD.
A documentação do repositório oficial ressalta que o HRX ainda não é um componente oficial definitivo da pilha ROCm. Mudanças em APIs, empacotamento e detalhes de implantação são esperadas enquanto a ferramenta amadurece, sendo hoje voltada estritamente para testes de infraestrutura e desenvolvedores de baixo nível.
O que isso muda na prática e o hardware suportado
O ecossistema ROCm (Radeon Open Compute) é a principal resposta da AMD ao CUDA da NVIDIA, permitindo que desenvolvedores escrevam e portem códigos de aceleração de hardware de forma mais acessível. O HIP é a interface de programação (C++ dialect) que facilita justamente essa portabilidade.
Ao criar o HRX System, a AMD tenta reduzir o custo de transação (overhead) entre a aplicação e o hardware. Para quem utiliza aceleradores da AMD em servidores e infraestrutura de inteligência artificial, um runtime de menor latência se traduz em maior eficiência, especialmente em sistemas heterogêneos.
A configuração atual de compilação do projeto revela suporte explícito a alvos de hardware genéricos da arquitetura AMDGPU muito recentes, especificamente:
- gfx942: Arquitetura CDNA 3, utilizada nos poderosos aceleradores Instinct MI300.
- gfx1151 / gfx1201: Variantes das arquiteturas RDNA, voltadas para APUs modernas e futuras gerações de gráficos de consumo/borda.
Como o HRX System funciona e a interceptação de chamadas

Do ponto de vista técnico, o projeto é composto por componentes de runtime essenciais, ferramentas de compilação e um conjunto de testes de conformidade (CTS). O sistema exporta a biblioteca pública libhrx.so, utilitários de informação (hrx-info) e cabeçalhos para a API nativa de baixa latência.
Para facilitar a adoção e os testes, a AMD incluiu uma camada de compatibilidade HIP. O pacote fornece uma versão própria da biblioteca libamdhip64.so. O grande diferencial é que os desenvolvedores não precisam recompilar seus aplicativos originais feitos para HIP.
A documentação orienta o uso da variável de ambiente LD_PRELOAD no Linux. Esse recurso do vinculador dinâmico (dynamic linker) força a aplicação a carregar a biblioteca do HRX antes das bibliotecas padrão do sistema, roteando todas as chamadas de GPU através da nova infraestrutura experimental.
Além disso, o repositório inclui ferramentas de “passthrough” e interceptação (localizadas em libhrx/src/passthrough/). Elas funcionam como utilitários de depuração, permitindo que os engenheiros comparem o comportamento e o desempenho das chamadas executadas no HRX com as executadas no runtime HIP original do ROCm.
Compilação e ecossistema
O repositório do HRX no GitHub mostra que o código-fonte é majoritariamente escrito em linguagem C (aproximadamente 58%) e C++ (cerca de 21%). As ferramentas de automação e análise estática são construídas em Python (15%).
A compilação do HRX exige um ambiente ROCm já configurado no sistema (seja pacote ou código-fonte), dependendo de cabeçalhos do HSA (Heterogeneous System Architecture), perfis AQL e da cadeia de ferramentas ROCm LLVM. Os desenvolvedores podem utilizar tanto o CMake quanto o Bazel para gerar os binários.
Embora o foco principal seja o ecossistema Linux (com artefatos de lançamento hrx-public-linux-x86_64), a infraestrutura já prevê compilações iniciais para Windows, gerando a biblioteca dinâmica hrx.dll, o que indica um esforço da AMD em unificar o suporte de desenvolvimento de IA e aceleração de hardware em ambos os sistemas operacionais.
