// https://syzkaller.appspot.com/bug?id=62db7f0b628381f621ab352d501352f0cb359ba1 // Copyright 2026 syzkaller project authors. All rights reserved. // Use of this source code is governed by Apache 2 LICENSE that can be found in the LICENSE file. // IMPORTANT: Do not copy the macros or definitions below directly into your reproducer. // Instead, add the following line to your reproducer: // #include "race_toolkit.h" // --- Race Condition Toolkit --- // Macros and snippets for CPU pinning, memory barriers, and userfaultfd. #define _GNU_SOURCE #include #include #include #include #include #include #include #include #include #include #include #include #include #include // Unbuffered I/O: Ensure logs are written immediately. #define SETUP_UNBUFFERED_IO() setvbuf(stdout, NULL, _IONBF, 0) // CPU Pinning: Pin the current thread to a specific CPU core. #define PIN_TO_CPU(cpu) \ do { \ cpu_set_t mask; \ CPU_ZERO(&mask); \ CPU_SET(cpu, &mask); \ if (sched_setaffinity(0, sizeof(mask), &mask) == -1) { \ perror("sched_setaffinity"); \ } \ } while (0) // Memory Barrier: Ensure memory ordering. #define MB() __atomic_thread_fence(__ATOMIC_SEQ_CST) // Spin-wait Barrier: Wait until a memory location has a specific value. // Best for tight race windows (low latency, no context switches). #define WAIT_ON(addr, val) \ do { \ while (__atomic_load_n(addr, __ATOMIC_ACQUIRE) != (val)) \ ; \ } while (0) // Signal: Set a memory location to a specific value to release a WAIT_ON. #define SIGNAL(addr, val) __atomic_store_n(addr, val, __ATOMIC_RELEASE) // --- Timing Primitives --- // Robust timing loops in VM environments (using CLOCK_MONOTONIC to avoid time(NULL) jumps). static inline double timer_elapsed_sec(struct timespec* start) { struct timespec now; if (clock_gettime(CLOCK_MONOTONIC, &now) == -1) { perror("clock_gettime(CLOCK_MONOTONIC) elapsed"); exit(1); } return (double)(now.tv_sec - start->tv_sec) + (double)(now.tv_nsec - start->tv_nsec) / 1e9; } // Initialize a monotonic timer variable. #define TIMER_START(t) \ struct timespec t; \ if (clock_gettime(CLOCK_MONOTONIC, &t) == -1) { \ perror("clock_gettime(CLOCK_MONOTONIC) start"); \ exit(1); \ } // Check if the elapsed time since 't' is less than 'sec' seconds. #define TIMER_NOT_EXPIRED(t, sec) (timer_elapsed_sec(&(t)) < (double)(sec)) // Futex-based Event: Shared with syzkaller executor. // Best for general synchronization or longer waits to save CPU. typedef struct { int state; } event_t; static void event_init(event_t* ev) { ev->state = 0; } static void event_reset(event_t* ev) { ev->state = 0; } static void event_set(event_t* ev) { if (__atomic_load_n(&ev->state, __ATOMIC_ACQUIRE)) { fprintf(stderr, "event already set\n"); exit(1); } __atomic_store_n(&ev->state, 1, __ATOMIC_RELEASE); syscall(SYS_futex, &ev->state, FUTEX_WAKE | FUTEX_PRIVATE_FLAG, 1000000); } static void event_wait(event_t* ev) { while (!__atomic_load_n(&ev->state, __ATOMIC_ACQUIRE)) syscall(SYS_futex, &ev->state, FUTEX_WAIT | FUTEX_PRIVATE_FLAG, 0, 0); } // userfaultfd setup: Register a memory range for page fault handling. static int setup_uffd(void* addr, size_t len) { int uffd = syscall(__NR_userfaultfd, O_CLOEXEC | O_NONBLOCK); if (uffd == -1) return -1; struct uffdio_api api = {.api = UFFD_API, .features = 0}; if (ioctl(uffd, UFFDIO_API, &api) == -1) { close(uffd); return -1; } struct uffdio_register reg = { .range = {.start = (uintptr_t)addr, .len = len}, .mode = UFFDIO_REGISTER_MODE_MISSING}; if (ioctl(uffd, UFFDIO_REGISTER, ®) == -1) { close(uffd); return -1; } return uffd; } // --- Guidance on Usage --- // 1. Use WAIT_ON/SIGNAL for tight race conditions to avoid scheduling overhead. // 2. Use event_t (futexes) for general coordination or when waiting for longer periods. // 3. Always use PIN_TO_CPU to increase race probability on multi-core systems. // 4. Use setup_uffd to register a memory range for page fault handling. This allows you to // pause a thread accessing that memory until you handle the fault, creating a reliable // and controllable race window. // 5. Call SETUP_UNBUFFERED_IO() at the start of main() to ensure that logs are printed // immediately. This is essential for understanding the exact interleaving of events // when debugging race conditions. // 6. For timing-based loops (e.g., running a race for 10 seconds), do NOT use time(NULL) // or loops relying on real-time clocks, as VM clocks are highly unreliable and can fail or drift. // Instead, use the robust monotonic timing primitives TIMER_START and TIMER_NOT_EXPIRED: // TIMER_START(start); // while (TIMER_NOT_EXPIRED(start, 10.0)) { // // Your race logic here // } #include #include #include #include #include #include #include #include #include #include #include #include #include #include #define NETLINK_RDMA 20 #define RDMA_NL_NLDEV 5 #define RDMA_NLDEV_CMD_NEWLINK 3 #define RDMA_NLDEV_ATTR_DEV_NAME 2 #define RDMA_NLDEV_ATTR_NDEV_NAME 51 #define RDMA_NLDEV_ATTR_LINK_TYPE 65 static int create_dummy_interface(const char *name) { int fd = socket(AF_NETLINK, SOCK_RAW, NETLINK_ROUTE); if (fd < 0) return -1; struct { struct nlmsghdr nlh; struct ifinfomsg ifm; char buf[1024]; } req = {0}; req.nlh.nlmsg_len = NLMSG_LENGTH(sizeof(struct ifinfomsg)); req.nlh.nlmsg_flags = NLM_F_REQUEST | NLM_F_CREATE | NLM_F_EXCL | NLM_F_ACK; req.nlh.nlmsg_type = RTM_NEWLINK; req.nlh.nlmsg_seq = 1; req.ifm.ifi_family = AF_UNSPEC; struct rtattr *rta; rta = (struct rtattr *)(((char *)&req) + NLMSG_ALIGN(req.nlh.nlmsg_len)); rta->rta_type = IFLA_IFNAME; rta->rta_len = RTA_LENGTH(strlen(name) + 1); strcpy(RTA_DATA(rta), name); req.nlh.nlmsg_len = NLMSG_ALIGN(req.nlh.nlmsg_len) + RTA_ALIGN(rta->rta_len); struct rtattr *linkinfo = (struct rtattr *)(((char *)&req) + NLMSG_ALIGN(req.nlh.nlmsg_len)); linkinfo->rta_type = IFLA_LINKINFO; linkinfo->rta_len = RTA_LENGTH(0); rta = (struct rtattr *)(((char *)linkinfo) + RTA_ALIGN(linkinfo->rta_len)); rta->rta_type = IFLA_INFO_KIND; rta->rta_len = RTA_LENGTH(strlen("dummy") + 1); strcpy(RTA_DATA(rta), "dummy"); linkinfo->rta_len += RTA_ALIGN(rta->rta_len); req.nlh.nlmsg_len = NLMSG_ALIGN(req.nlh.nlmsg_len) + RTA_ALIGN(linkinfo->rta_len); struct sockaddr_nl sa = { .nl_family = AF_NETLINK }; sendto(fd, &req, req.nlh.nlmsg_len, 0, (struct sockaddr *)&sa, sizeof(sa)); struct { struct nlmsghdr nlh; struct nlmsgerr err; } resp; recv(fd, &resp, sizeof(resp), 0); close(fd); return resp.err.error; } static int delete_interface(const char *name) { int fd = socket(AF_NETLINK, SOCK_RAW, NETLINK_ROUTE); if (fd < 0) return -1; struct { struct nlmsghdr nlh; struct ifinfomsg ifm; char buf[1024]; } req = {0}; req.nlh.nlmsg_len = NLMSG_LENGTH(sizeof(struct ifinfomsg)); req.nlh.nlmsg_flags = NLM_F_REQUEST | NLM_F_ACK; req.nlh.nlmsg_type = RTM_DELLINK; req.nlh.nlmsg_seq = 1; req.ifm.ifi_family = AF_UNSPEC; struct rtattr *rta; rta = (struct rtattr *)(((char *)&req) + NLMSG_ALIGN(req.nlh.nlmsg_len)); rta->rta_type = IFLA_IFNAME; rta->rta_len = RTA_LENGTH(strlen(name) + 1); strcpy(RTA_DATA(rta), name); req.nlh.nlmsg_len = NLMSG_ALIGN(req.nlh.nlmsg_len) + RTA_ALIGN(rta->rta_len); struct sockaddr_nl sa = { .nl_family = AF_NETLINK }; sendto(fd, &req, req.nlh.nlmsg_len, 0, (struct sockaddr *)&sa, sizeof(sa)); struct { struct nlmsghdr nlh; struct nlmsgerr err; } resp; recv(fd, &resp, sizeof(resp), 0); close(fd); return resp.err.error; } static void bring_up_interface(const char *name) { int fd = socket(AF_INET, SOCK_DGRAM, 0); if (fd < 0) return; struct ifreq ifr; strcpy(ifr.ifr_name, name); if (ioctl(fd, SIOCGIFFLAGS, &ifr) == 0) { ifr.ifr_flags |= IFF_UP; ioctl(fd, SIOCSIFFLAGS, &ifr); } close(fd); } static int send_rdma_newlink(const char *ibdev_name, const char *link_type, const char *ndev_name) { int fd = socket(AF_NETLINK, SOCK_RAW, NETLINK_RDMA); if (fd < 0) return -1; struct { struct nlmsghdr nlh; char buf[1024]; } req = {0}; req.nlh.nlmsg_len = NLMSG_LENGTH(0); req.nlh.nlmsg_type = (RDMA_NL_NLDEV << 10) | RDMA_NLDEV_CMD_NEWLINK; req.nlh.nlmsg_flags = NLM_F_REQUEST | NLM_F_ACK; req.nlh.nlmsg_seq = 1; struct rtattr *rta; rta = (struct rtattr *)(((char *)&req) + NLMSG_ALIGN(req.nlh.nlmsg_len)); rta->rta_type = RDMA_NLDEV_ATTR_DEV_NAME; rta->rta_len = RTA_LENGTH(strlen(ibdev_name) + 1); strcpy(RTA_DATA(rta), ibdev_name); req.nlh.nlmsg_len = NLMSG_ALIGN(req.nlh.nlmsg_len) + RTA_ALIGN(rta->rta_len); rta = (struct rtattr *)(((char *)&req) + NLMSG_ALIGN(req.nlh.nlmsg_len)); rta->rta_type = RDMA_NLDEV_ATTR_LINK_TYPE; rta->rta_len = RTA_LENGTH(strlen(link_type) + 1); strcpy(RTA_DATA(rta), link_type); req.nlh.nlmsg_len = NLMSG_ALIGN(req.nlh.nlmsg_len) + RTA_ALIGN(rta->rta_len); rta = (struct rtattr *)(((char *)&req) + NLMSG_ALIGN(req.nlh.nlmsg_len)); rta->rta_type = RDMA_NLDEV_ATTR_NDEV_NAME; rta->rta_len = RTA_LENGTH(strlen(ndev_name) + 1); strcpy(RTA_DATA(rta), ndev_name); req.nlh.nlmsg_len = NLMSG_ALIGN(req.nlh.nlmsg_len) + RTA_ALIGN(rta->rta_len); struct sockaddr_nl sa = { .nl_family = AF_NETLINK }; sendto(fd, &req, req.nlh.nlmsg_len, 0, (struct sockaddr *)&sa, sizeof(sa)); struct { struct nlmsghdr nlh; struct nlmsgerr err; } resp; recv(fd, &resp, sizeof(resp), 0); close(fd); return resp.err.error; } int main() { SETUP_UNBUFFERED_IO(); TIMER_START(start); srand(time(NULL) ^ getpid()); int iter = 0; while (TIMER_NOT_EXPIRED(start, 10.0)) { char dummy_name[32]; char rxe_name[32]; sprintf(dummy_name, "dummy%d", iter); sprintf(rxe_name, "rxe%d", iter); int res = create_dummy_interface(dummy_name); if (res < 0 && res != -EEXIST) { printf("[-] Failed to create dummy interface: %d\n", res); exit(1); } bring_up_interface(dummy_name); res = send_rdma_newlink(rxe_name, "rxe", dummy_name); if (res < 0) { printf("[-] Failed to create RXE device: %d\n", res); } int p[2]; if (pipe(p) < 0) { exit(1); } pid_t pid = fork(); if (pid == 0) { close(p[0]); if (unshare(CLONE_NEWNET) < 0) { exit(1); } // Signal parent that we are in new netns if (write(p[1], "1", 1) != 1) {} // Wait for parent to signal us to exit char c; if (read(p[1], &c, 1) != 1) {} // Exit, triggering cleanup_net exit(0); } close(p[1]); char c; // Wait for child to unshare if (read(p[0], &c, 1) != 1) {} close(p[0]); // Signal child to exit kill(pid, SIGKILL); // Random delay between 0 and 50ms to hit the race window // cleanup_net blocks on synchronize_rcu() which takes some time usleep(rand() % 50000); // Immediately delete the dummy interface to trigger ib_unregister_work delete_interface(dummy_name); waitpid(pid, NULL, 0); // Wait a bit for workqueues to finish usleep(50000); iter++; } printf("[+] Reproducer finished.\n"); return 0; }