<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Fine-tuning on Dino Hacks</title>
    <link>/tags/fine-tuning/</link>
    <description>Recent content in Fine-tuning on Dino Hacks</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>en-us</language>
    <lastBuildDate>Sat, 08 Aug 2026 21:09:17 +0530</lastBuildDate><atom:link href="/tags/fine-tuning/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Fine-Tuning LFM2.5-1.2B for a Grid Navigation Task</title>
      <link>/posts/2026/2026-08-08-fine-tuning-lfm-2.5-1.2b-for-grid-navigation-task/</link>
      <pubDate>Sat, 08 Aug 2026 21:09:17 +0530</pubDate>
      
      <guid>/posts/2026/2026-08-08-fine-tuning-lfm-2.5-1.2b-for-grid-navigation-task/</guid>
      <description>Table of Contents Background Choosing the model Training the model Baseline Performance Approach 1: Multi-Turn GRPO RL Approach 2: SFT + Multi-Turn PPO Generating the trajectories for SFT Multi-turn PPO Approach 3 (Winning Approach): Simplified Reasoning SFT + Multi-Turn GRPO Simplified trajectory ChatGPT 5.5 Instant simplified reasoning (context-aware based reasoning). Sonnet 5 simplified reasoning. Gemini 3.6 Flash simplified reasoning. Results after Simplified Reasoning SFT 5x5 grid performance 10x10 grid performance Results after Multi-turn GRPO 5x5 grid performance 10x10 grid performance Miscellaneous testing of trained models Think/Reasoning Content 5x5 grid performance without previous reasoning 10x10 grid performance without previous reasoning Effects on benchmark results Performance on sampled benchmark subsets Conclusion Appendix Background In the previous blog post Are LLMs Capable Of Spatial Reasoning?</description>
    </item>
    
  </channel>
</rss>
