BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//pretalx//pretalx.devconf.info//devconf-us-2026//speaker//PPRHTX
BEGIN:VTIMEZONE
TZID:EST
BEGIN:STANDARD
DTSTART:20001029T030000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=10;UNTIL=20061029T070000Z
TZNAME:EST
TZOFFSETFROM:-0400
TZOFFSETTO:-0500
END:STANDARD
BEGIN:STANDARD
DTSTART:20071104T030000
RRULE:FREQ=YEARLY;BYDAY=1SU;BYMONTH=11
TZNAME:EST
TZOFFSETFROM:-0400
TZOFFSETTO:-0500
END:STANDARD
BEGIN:DAYLIGHT
DTSTART:20000402T030000
RRULE:FREQ=YEARLY;BYDAY=1SU;BYMONTH=4;UNTIL=20060402T080000Z
TZNAME:EDT
TZOFFSETFROM:-0500
TZOFFSETTO:-0400
END:DAYLIGHT
BEGIN:DAYLIGHT
DTSTART:20070311T030000
RRULE:FREQ=YEARLY;BYDAY=2SU;BYMONTH=3
TZNAME:EDT
TZOFFSETFROM:-0500
TZOFFSETTO:-0400
END:DAYLIGHT
END:VTIMEZONE
BEGIN:VEVENT
UID:pretalx-devconf-us-2026-JLMV9M@pretalx.devconf.info
DTSTART;TZID=EST:20260924T140000
DTEND;TZID=EST:20260924T141500
DESCRIPTION:Large language model deployments commonly serve latency-sensiti
 ve online requests alongside latency-insensitive workloads such as documen
 t summarization\, classification\, embedding generation\, and model evalua
 tion. Running both workload types without proper coordination can cause ba
 tch traffic to consume inference capacity and negatively impact interactiv
 e users.\nThis lightning talk introduces llm-d-async\, an asynchronous pro
 cessing component for llm-d. It explains how requests are placed in queues
 \, processed through worker pools\, controlled by dispatch gates\, and for
 warded to the inference gateway. The talk will show how llm-d-async enable
 s batch workloads to use available inference capacity while protecting int
 eractive traffic.
DTSTAMP:20260924T235727Z
LOCATION:Hewitt Boardroom (Capacity 35)
SUMMARY:llm-d-async: Efficient Asynchronous Inference for Batch Workloads -
  Madhu Goutham Reddy Ambati\, Aneesh Puttur
URL:https://pretalx.devconf.info/devconf-us-2026/talk/JLMV9M/
END:VEVENT
END:VCALENDAR
