Skip to content

[Bug]: Delivery retry loop corrupts active sessions (R-004) — retry selector bypasses delivery.mode=none #91420

Description

@CarotaWealth

Bug type

Regression (worked before, now fails)

Beta release blocker

No

Summary

Version: OpenClaw 2026.6.1 (2e08f0f)
OS: macOS

Bug: When a delivery fails, the gateway retry mechanism cycles through
active sessions as relay vehicles, bypassing delivery.mode=none. This
corrupts the sessions being used as relays, causing LLM schema errors
on next startup.

Pattern observed:

  • Agent sends message, believes it sent
  • Delivery retry fires on alternating channels (webchat → unknown)
  • Same payload delivered 3x in a row
  • Sessions used as relay vehicles become corrupted
  • Affected agents hit "LLM request failed: provider rejected the request
    schema or tool payload" on next turn

Workaround: Manual session clear via sessions.json + gateway restart.

Expected behavior: Retry logic should not use active persistent main
sessions as relay vehicles. delivery.mode=none should be respected at
the retry layer.

Steps to reproduce

  1. Run a multi-agent fleet with persistent main sessions on multiple agents (coordinator, vice-chair, cortex).
  2. Agent attempts to send a message via sessions_send tool.
  3. Delivery fails on primary channel.
  4. Gateway retry mechanism fires — cycles through active persistent main sessions as relay vehicles.
  5. Same payload delivered 3x on alternating channels (webchat → unknown).
  6. Affected relay sessions become corrupted.
  7. On next startup, corrupted agents hit "LLM request failed: provider rejected the request schema or tool payload."

Expected behavior

Retry logic should not use active persistent main sessions as relay vehicles. delivery.mode=none should be respected at the retry layer. Retries should fail gracefully without corrupting unrelated sessions.

Actual behavior

Gateway retry selector bypasses delivery.mode=none by cycling active sessions as relay vehicles. Results in session corruption, LLM schema errors on next startup, and repeated delivery of the same payload on alternate channels. Workaround: manual session clear via sessions.json + gateway restart.

OpenClaw version

2026.6.1 (2e08f0f)

Operating system

macOS 15.4

Install method

npm global

Model

anthropic/claude-opus-4-6 / anthropic/claude-sonnet-4-6

Provider / routing chain

openclaw -> anthropic

Additional provider/model setup details

No response

Logs, screenshots, and evidence

Impact and severity

Affected: All persistent main sessions fleet-wide (16 agents).
Severity: Blocks workflow — corrupted sessions require manual
intervention to clear (sessions.json edit + gateway restart) before
affected agents can function.
Frequency: Intermittent — triggers when delivery fails on a session
that has active persistent main sessions running.
Consequence: Agent downtime, repeated duplicate message delivery
on alternate channels, manual recovery required each occurrence.
In a production multi-agent RIA compliance fleet, this causes
unplanned outages during business hours.

openclaw_june7_log.txt

Additional information

No response

Metadata

Metadata

Assignees

No one assigned

    Labels

    P1High-priority user-facing bug, regression, or broken workflow.bugSomething isn't workingclawsweeper:needs-live-reproClawSweeper needs live local, crabbox, or manual validation to confirm this issue.impact:message-lossChannel message delivery can be lost, duplicated, or misrouted.impact:session-stateSession, memory, transcript, context, or agent state can drift or corrupt.issue-rating: 🐚 platinum hermitGood issue quality with a plausible reproduction path needing some confirmation.regressionBehavior that previously worked and now fails

    Type

    No type

    Fields

    Priority

    None yet

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions