賢いLLMほど、大きく負けた。同じルールで haiku と sonnet にデイトレをさせてみた
日経225のバックテストで、トレードの判断だけをLLMに任せて、モデルを claude-haiku-4.5 から claude-sonnet-5 に替えてみました。勝率はほぼ同じなのに、損失は約3倍。差を生んだのは判断の質ではなくポジションサイズでした。数字は全部、仮想口座の元本比で書きます。
ls /tags/agent
AI Agent の設計から運用まで。自分で作って動かした記録と、良くなったかの測り方。
2 記事
日経225のバックテストで、トレードの判断だけをLLMに任せて、モデルを claude-haiku-4.5 から claude-sonnet-5 に替えてみました。勝率はほぼ同じなのに、損失は約3倍。差を生んだのは判断の質ではなくポジションサイズでした。数字は全部、仮想口座の元本比で書きます。
値動きの根拠を確証度つきで返す調査エージェントを設計していて、最初は LangGraph の Swarm で考えていました。やめてグラフにした理由 —— 特に「いつ終わるか」まで LLM に任せることになる点 —— と、比べた構成を全部書きます。設計だけで、まだ動かしていません。