ROBOTWAR.ioOSINT research running on the Hetzner inference APIbeta test

Hetzner Inference API — Performance


Measured from robotwar.io Hetzner OSINT · generated 2026-08-23T06:18:55Z · window: last 30 days (all-time totals in summary)

Calls in window
916
916 all time
Success rate
74.8%
685 completed
Latency p50
48.5 s
p95 235.7 s
Output tokens/s
29.6
median of completed calls
Rate limited
0.0%
0 responses
Server errors
25.0%
229 incl. gateway 504
Timeouts
0.0%
0 calls
Parse errors
0.0%
0 calls
Tokens in
3 536 681
3 536 681 all time
Tokens out
1 232 381
1 232 381 all time
Attempts per success
1.1
1.0 = never retried
Retries
194
calls beyond the first attempt

Collection schedule

All times on this page are Amsterdam (CET/CEST). A missed slot means no collection started within the tolerance of a scheduled time.

Collection runs at 00:00, 08:00, 16:00 Europe/Amsterdam · next expected 2026-08-23 16:00 CEST · arrived 15 of 20 expected since 2026-08-16 · 5 did not finish

Last completed collection started 2026-08-22 16:00 CEST and took 20 min.

Missed: 2026-08-17 00:00, 2026-08-17 08:00, 2026-08-17 16:00, 2026-08-18 00:00, 2026-08-19 16:00

starteddurationstatus
2026-08-23 08:00 CESTrunning (unfinished)
2026-08-23 00:00 CEST21 minfailed
2026-08-22 16:00 CEST20 minok
2026-08-22 08:00 CEST16 minok
2026-08-22 00:00 CEST17 minok
2026-08-21 16:00 CEST19 minok
2026-08-21 08:00 CEST24 minfailed
2026-08-21 00:00 CEST45 minok
2026-08-20 16:00 CEST27 minok
2026-08-20 08:00 CEST26 minok
2026-08-20 03:11 CESTrunning (unfinished)
2026-08-20 03:09 CEST36 minfailed

Model selection

Chosen from measurement: a model is used once the endpoint offers it and it has answered reliably, inside the response-time limit.

stepmodelhowsincewhy
corroborateQwen3.8-27Bevidence2026-08-22beats Qwen/Qwen3.6-35B-A3B-FP8 by 0.948 on measured reliability and speed
deepQwen/Qwen3.6-35B-A3B-FP8held2026-08-22still the best measured option
lensQwen3.8-27Bevidence2026-08-22beats Qwen/Qwen3.6-35B-A3B-FP8 by 0.948 on measured reliability and speed
synthesizeQwen/Qwen3.6-35B-A3B-FP8held2026-08-22still the best measured option
tagQwen/Qwen3.6-35B-A3B-FP8held2026-08-22still the best measured option
trendwatchQwen/Qwen3.6-35B-A3B-FP8held2026-08-22still the best measured option

Calls by status, per day

Stacked by outcome, Amsterdam days.

Calls by status per day010020030040008-16 · ok: 5408-16 · http_error: 1908-16 · error: 208-17 · ok: 23608-17 · http_error: 8508-18 · ok: 12408-18 · http_error: 11108-19 · ok: 2408-19 · http_error: 908-20 · ok: 8208-21 · ok: 6308-21 · http_error: 108-22 · ok: 6208-23 · ok: 4008-23 · http_error: 407-2407-2808-0108-0508-0908-1308-1708-2108-23okhttp_errorerror

Speed over time

Latency percentiles cover completed calls; the dashed line is the 7-day mean.

Latency per day (successful calls)0ms75s2m4m5m08-16 · p50: 51s08-17 · p50: 57s08-18 · p50: 70s08-19 · p50: 93s08-20 · p50: 49s08-21 · p50: 34s08-22 · p50: 14s08-23 · p50: 20s08-16 · p95: 4m08-17 · p95: 4m08-18 · p95: 5m08-19 · p95: 4m08-20 · p95: 2m08-21 · p95: 107s08-22 · p95: 49s08-23 · p95: 43s07-2407-2808-0108-0508-0908-1308-1708-2108-23p50p95
Median output tokens per second, per day0387511215008-16 · median tokens/s: 2808-17 · median tokens/s: 2708-18 · median tokens/s: 2608-19 · median tokens/s: 1908-20 · median tokens/s: 3608-21 · median tokens/s: 4908-22 · median tokens/s: 10108-23 · median tokens/s: 8607-2407-2808-0108-0508-0908-1308-1708-2108-23
Success rate per day0%25%50%75%100%08-16 · success rate: 72%08-17 · success rate: 74%08-18 · success rate: 53%08-19 · success rate: 73%08-20 · success rate: 100%08-21 · success rate: 98%08-22 · success rate: 100%08-23 · success rate: 91%08-16 · 7-day mean: 72%08-17 · 7-day mean: 73%08-18 · 7-day mean: 66%08-19 · 7-day mean: 68%08-20 · 7-day mean: 74%08-21 · 7-day mean: 78%08-22 · 7-day mean: 81%08-23 · 7-day mean: 84%07-2407-2808-0108-0508-0908-1308-1708-2108-23success rate7-day mean

Latency per model

Median latency per Amsterdam day.

Qwen/Qwen3.6-35B-A3B-FP8

Qwen/Qwen3.6-35B-A3B-FP8: median latency per day0ms33s67s100s08-16 · p50: 50s08-17 · p50: 57s08-18 · p50: 70s08-19 · p50: 93s08-20 · p50: 49s08-21 · p50: 34s08-22 · p50: 14s08-23 · p50: 20s07-2407-3108-0708-1408-2108-23

Kimi-K2.7-Code

Kimi-K2.7-Code: median latency per day0ms0ms0ms1ms07-2407-3108-0708-1408-2108-23

DeepSeek-V4-Flash-0731

DeepSeek-V4-Flash-0731: median latency per day0ms0ms0ms1ms07-2407-3108-0708-1408-2108-23

GLM-5.2-NVFP4

GLM-5.2-NVFP4: median latency per day0ms83s3m4m08-16 · p50: 4m07-2407-3108-0708-1408-2108-23

Per model

Window: last 30 days. First/last seen span the whole log.

modelcallssuccessp50p95maxtok/savg out4295xxtimeoutsfirst seenlast seen
Qwen/Qwen3.6-35B-A3B-FP889476.4%48.4 s235.5 s297.5 s29.61 783021002026-08-162026-08-23
Kimi-K2.7-Code100.0%01002026-08-162026-08-16
DeepSeek-V4-Flash-073160.0%0502026-08-162026-08-16
GLM-5.2-NVFP4633.3%240.8 s243.1 s243.4 s5.91 4300402026-08-162026-08-16

Model bench runs

Same prompt, same signals, every model.

whenmodelparsedlatencytokens intokens out
2026-08-16 19:26Qwen/Qwen3.6-35B-A3B-FP8yes76.2 s4 3101 621
2026-08-16 19:25Kimi-K2.7-Codeno
2026-08-16 19:17GLM-5.2-NVFP4yes243.4 s3 9991 698
2026-08-16 18:57DeepSeek-V4-Flash-0731no

Per step

Repair calls are the single retry after an unparseable answer.

stepcallssuccessp50p95avg inavg outrepair calls
tag64569.3%56.3 s238.5 s5 7781 9461
synthesize4895.8%41.0 s258.0 s5 2982 0771
trendwatch3174.2%63.1 s195.0 s10 2672 8610
lens-nl20100.0%17.9 s82.0 s1 3698200
lens-de20100.0%26.9 s140.9 s5 1621 2680
lens-wider1989.5%24.1 s89.5 s4 9521 3501
lens-pl1888.9%20.4 s55.5 s1 8989540
lens-cn1794.1%24.0 s116.6 s3 2411 5720
lens-ir17100.0%20.9 s85.1 s2 3511 1131
lens-baltics17100.0%21.8 s98.9 s1 9851 0831
lens-by17100.0%14.0 s53.3 s1 0896661
enrich1668.8%234.9 s264.3 s2 8811 9870
lens-kp16100.0%17.8 s73.4 s2 1161 1510
bench1513.3%159.8 s235.0 s4 1541 6600

Failures over time

Failures by class per day0387511215008-16 · gateway 504: 1908-16 · empty completion: 208-17 · gateway 504: 6308-17 · 5xx: 2208-18 · gateway 504: 10708-18 · 5xx: 408-19 · gateway 504: 808-19 · 5xx: 108-21 · gateway 504: 108-23 · 5xx: 407-2407-2808-0108-0508-0908-1308-1708-2108-23gateway 5045xxempty completion

Most recent failures

Last 20, newest first.

whenstepmodelhttpclassmessage
2026-08-23 06:07lens-plQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Too many open files (os error 24)
2026-08-23 06:07lens-plQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Too many open files (os error 24)
2026-08-23 06:03tagQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Too many open files (os error 24)
2026-08-23 06:02tagQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Too many open files (os error 24)
2026-08-20 22:21lens-cnQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-19 06:26lens-widerQwen/Qwen3.6-35B-A3B-FP85025xx502 Bad Gateway
2026-08-18 23:05trendwatchQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 22:59trendwatchQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 22:54trendwatchQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 22:41tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 22:35tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 22:30tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 22:25tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 22:20tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 21:13lens-widerQwen/Qwen3.6-35B-A3B-FP85035xx503 upstream call failed: Connect: Connection refused (os error 111)
2026-08-18 21:00trendwatchQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 20:55trendwatchQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 20:50trendwatchQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 09:23tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504
2026-08-18 09:18tagQwen/Qwen3.6-35B-A3B-FP8504gateway 504504

Time of day

Amsterdam hours across the whole window.

Median latency — darker is slower

Median latency by hour (Amsterdam)00: 44.4 s0001: 54.2 s02: 61.0 s0203: 47.0 s04: no calls0405: 177.5 s06: 184.3 s0607: 182.3 s08: 36.3 s0809: 114.3 s10: no calls1011: 27.7 s12: no calls1213: no calls14: no calls1415: 234.9 s16: 24.7 s1617: 64.5 s18: 166.1 s1819: no calls20: 48.0 s2021: 160.4 s22: 54.5 s2223: 62.8 s

Failure share — darker is worse

Failure share by hour (Amsterdam)00: 11.6%0001: 11.4%02: 9.2%0203: 18.8%04: 100.0%0405: 25.0%06: 69.2%0607: 61.5%08: 12.6%0809: 93.3%10: 100.0%1011: 17.1%12: no calls1213: no calls14: no calls1415: 0.0%16: 11.2%1617: 44.4%18: 88.9%1819: 100.0%20: 75.9%2021: 55.6%22: 17.7%2223: 43.3%

916 calls placed across the window

Model availability over time

One availability check per day from /models; calls per model per Amsterdam day; last 14 days. Watch this when a model disappears.

The endpoint currently lists 2 models: Qwen/Qwen3.6-35B-A3B-FP8, Qwen3.8-27B. Not offered on the latest check: DeepSeek-V4-Flash-0731 (last seen 2026-08-16); GLM-5.2-NVFP4 (last seen 2026-08-16); Kimi-K2.7-Code (last seen 2026-08-16). This timeline shows if and when they return.

08-1008-1108-1208-1308-1408-1508-1608-1708-1808-1908-2008-2108-2208-23
DeepSeek-V4-Flash-07316×××××××
GLM-5.2-NVFP42×××××××
Kimi-K2.7-Code10×××××××
Qwen/Qwen3.6-35B-A3B-FP8522361242482636240
Qwen3.8-27B××

offered and used successfully (number = ok calls) offered, every call failed offered, not used not offered on /models no availability check that day

Notable changes

API surface over time

Capability flags are observed, never assumed.

takenendpointsdkmodelschange
2026-08-23 06:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-22 14:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-22 06:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-21 22:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-21 14:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-20 22:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-20 14:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-20 06:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-20 01:11https://inference.hetzner.com/api/v12.49.02no change
2026-08-19 22:00https://inference.hetzner.com/api/v12.49.02no change
2026-08-18 22:01https://inference.hetzner.com/api/v12.49.02no change
2026-08-18 20:32https://inference.hetzner.com/api/v12.49.02no change
2026-08-18 14:00https://inference.hetzner.com/api/v12.49.02+Qwen3.8-27B
2026-08-18 09:31https://inference.hetzner.com/api/v12.49.01no change
2026-08-18 06:00https://inference.hetzner.com/api/v12.49.01no change
2026-08-17 16:38https://inference.hetzner.com/api/v12.49.01−DeepSeek-V4-Flash-0731 −GLM-5.2-NVFP4 −Kimi-K2.7-Code (1 model offered)
2026-08-16 17:56https://inference.hetzner.com/api/v12.49.04first snapshot (4 models) — reconstructed from the /models check at 19:56 CEST and the call log

Observed on the latest snapshot

thinking can be switched off: yesgateway 504 observed: norate-limit headers exposed: no

Models offered

Qwen/Qwen3.6-35B-A3B-FP8Qwen3.8-27B

Per-model first and last call

modelfirst calllast callcalls (all time)
DeepSeek-V4-Flash-07312026-08-162026-08-166
GLM-5.2-NVFP42026-08-162026-08-166
Kimi-K2.7-Code2026-08-162026-08-1610
Qwen/Qwen3.6-35B-A3B-FP82026-08-162026-08-23894

Rate-limit posture

Client budget: 10 requests / 60 s · observed 429 responses in window: 0 (0.0% of calls)

No rate-limit headers are exposed by the API — the client budget is the only guard.