Skip to content

feat(provider): add provider-specific safety and policy refusal markers - #639

Closed
Tiktokaiagent wants to merge 1 commit into
use-agent-os:mainfrom
Tiktokaiagent:comp/629-policy-refusal-markers-v2
Closed

feat(provider): add provider-specific safety and policy refusal markers#639
Tiktokaiagent wants to merge 1 commit into
use-agent-os:mainfrom
Tiktokaiagent:comp/629-policy-refusal-markers-v2

Conversation

@Tiktokaiagent

Copy link
Copy Markdown
Contributor

Summary

Adds provider-specific markers to _is_policy_refusal to catch refusal signals from various providers:

  • Azure OpenAI: content_filter, content filter, responsible_ai_policy, content management policy
  • OpenAI: flagged by content filter, blocked by safety
  • Anthropic: harmful_content
  • Gemini: blocked, safety_rating, safety_ratings
  • DeepSeek: sensitive_content

Also adds 7 parametrized test cases covering all provider-specific scenarios.

Fixes #629
Closes #629

Adds provider-specific markers to _is_policy_refusal for Azure OpenAI
(content_filter, responsible_ai_policy), Anthropic (harmful_content),
Gemini (safety_rating, blocked), DeepSeek (sensitive_content), and
generic safety blocks.

Fixes use-agent-os#629
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

[Feature]: Add common provider-specific safety and policy refusal markers to _is_policy_refusal

1 participant