Both Open d1 models run across NVIDIA DGX, RTX, and Jetson, with day-one llama.cpp support to run anywhere.
d1-3B single-question latency, measured one request at a time:
> NVIDIA RTX 4090: 8 ms
> Jetson AGX Thor: 16 ms
> Jetson AGX Orin 64 GB: 26 ms
> Jetson Orin Nano: 50 ms
d1-3B single-question latency, measured one request at a time:
> NVIDIA RTX 4090: 8 ms
> Jetson AGX Thor: 16 ms
> Jetson AGX Orin 64 GB: 26 ms
> Jetson Orin Nano: 50 ms
3 4 76